汉智

Hanji

关于

名字的由来

「Hanji」跟汉字在各地的叫法各差一个字母:汉语拼音的 hanzi 差一个 z,日语的 kanji 差一个 k,韩语的 hanja 差一个 a。同一件东西,每个地方都改掉一点点——这正是这个应用在讲的事。

它同时也是闽南语「漢字」的实际读音 hàn-jī,所以它并不是凭空造出来的词,而是又一地的读法。中文名「汉智」取其音。

收录范围

收录《通用规范汉字表》(2013)、臺灣《常用國字標準字體表》(1982)、香港《常用字字形表》、日本《常用漢字表》(2010)四份字表的并集,把简繁、日本新旧字体这类跨码点的对应合并成一行,共8,450行。

其中1,723行四地写法完全一致,587行四地各不相同。写法相同的字同样收录——这里是四地汉字的字表,字形差异只是其中一个维度。

台湾《次常用国字表》只为已有行提供二级收录状态和候选,不参与生成新行;其6,343个主条目中有3,599个独有条目明确在产品范围之外。

字形差异是怎么判定的

Source Han Sans与Source Han Serif(也就是Noto Sans CJK与Noto Serif CJK)各自的五个地区共享同一个字形池,每个地区有一份「码点→CID」映射。同一个池子里CID相同就是同一个字形,所以把中国大陆、香港、台湾、日本四份映射摆在一起比对,就能判断这四地把一个字写成了几种样子。

判定取两种字体的并集:只要黑体或宋体之中有任意一方认为两地同形,就算同形。因为Source Han Sans给日本单独画了约五分之一常用字的字形,其中两百来个宋体并没有跟着分——了、人、子、水、金都在其中。只有一种字体作出的区分是那套字体的设计取舍,不是地区规范的差异。

代价是:那些被合并的格子会改用同组代表地区的字体来渲染,也就不会显示Noto Sans JP自己那个略有出入的字形。这是「视为一样」的应有之义——页面上写着相同的两格,画出来也必须真的相同。

这份数据的局限

  • 这里测的是Source Han系列的地区字形设计,不是各地标准本身。它是个高质量的代理,因为Adobe的地区字形分别依据大陆《印刷通用汉字字形表》、台湾教育部《國字標準字體》、香港教育局《常用字字形表》、日本JIS X 0208/0213(JIS2004字形)。
  • Source Han的香港字形覆盖并不完整,所以「只有香港不同」这一类可能少报。
  • 笔画数逐地区取,先看Unihan的kAlternateTotalStrokes(它按IRG来源分别给数,最准,但只覆盖一百来个码点),日本再退到kRSAdobe_Japan1_6(它分析的是Adobe-Japan1-6收的日本字形,所以突是8画而不是9画),都没有才用kTotalStrokes——后者至多区分zh-Hans与zh-Hant两档,港台共用后一档。
  • 于是日本那一列常与其余三地不同,其中约五分之一其实字形一模一样,只是数法不同:日本把阝数作三画、ネ数作五画,所以那四地写法相同,笔画却是6/6/6/7。
  • OpenCC与各地规范字表冲突时以规范字表为准。它的异体表里混着「同字异形」和「一字代用另一字」;某地区的字表分开收录两者时就不归并。若只有一个地区提供证据,而候选还属于另一字组,则保守拆分,并在详情页用双向「关系未确认」链接提示。
  • 每个地区格会区分字表主条目、括注异体和未收录回退。未收录格仍显示传承参考字形;这些状态只在详情页说明,不在列表页增加角标。

声明

这里的数据不是权威数据。汉字的收录、字形、笔画、读音,各地标准之间本来就有分歧,也不存在一份能让所有人满意的数据。

为了不让这里变成一个需要长期人工维护的字表,本项目尽量贴着已有的公共数据走——Unicode Unihan、各地文化教育主管部门发布的规范字表、Adobe与Google公开的字体资源——原样取用。判定规则都写在上面,没有个人取舍,也不代表任何立场。

正式场合请以原始规范与词典为准。每个字的详情页都列了该地区自己的字典,可以逐条对照。

汉字数量巨大,出错难免。发现数据有误,请通过GitHub issue反馈。

取用数据

本站的字表数据以JSON提供,可直接取用:

数据来源

用途来源许可
判定四地字形差异Adobe Source Han Sans / Serif(CMap 资源)

每套字体的四份地区 CMap 给出「码点 → CID」映射,同一字形池内 CID 相同即同一字形。判定取黑体与宋体的并集。

SIL OFL 1.1
页面展示用字体Noto Sans / Noto Serif(含 CJK)

汉字取自 CJK 版本,拉丁字母与数字取自拉丁版本,都按站内用字子集化后自托管,OFL 声明随附于 /fonts/OFL.txt。

SIL OFL 1.1
简繁、港台异体、日本新旧字体对应OpenCC 开放中文转换Apache-2.0
四地标准字表zispace/hanzi-chars

转录自各地官方规范:《通用规范汉字表》(2013)、臺灣《常用國字標準字體表》(1982)、香港《常用字字形表》、日本《常用漢字表》(2010)与《学年別漢字配当表》(2017)。

仓库未声明
笔画数、读音Unicode Han Database (Unihan)Unicode License v3
大陆字频排名hanziDB.csv(Jun Da《现代汉语单字频率列表》)MIT

鸣谢

感谢OpenCC、Unicode Unihan、zispace/hanzi-chars、Jun Da《现代汉语单字频率列表》、Adobe Source Han与Noto CJK的维护者。逐字对照工具tofu.tools是本项目的先行者,同样用Noto系列区分四地字形。