片假名

日语表音文字之一,主要用于书写外来词、拟声词和学术术语。

片假名是日语表音文字之一,由 46 个基本字母 (清音) 加上浊音、半浊音和拗音构成的体系组成。它在平安时代通过简化汉字的一部分 (偏和旁) 而创造,字形棱角分明、线条笔直是其特征。与从汉字草书体演变而来的平假名不同,片假名是取出汉字的一部分而成立的。

片假名的主要用途是书写外来词。从英语等外语借入的词汇用片假名表记,如"コンピュータ" (computer)、"インターネット" (internet)、"プログラミング" (programming)。在 IT 领域,片假名词汇尤其多,"サーバー" (server)、"データベース" (database)、"アルゴリズム" (algorithm) 等术语占据技术文档相当大的比例,这并不罕见。

除外来词外,片假名还用于拟声词、拟态词 (ガタガタ 表示咔嗒声、キラキラ 表示闪闪发光、ドキドキ 表示心跳)、动植物的和名 (ネコ 猫、サクラ 樱)、强调表达和电报文等。在广告和漫画中,将通常用平假名书写的词故意用片假名表示,是一种制造视觉冲击力的常见手法。

在 Unicode 中,全角片假名配置在 U+30A0 到 U+30FF 的范围。另一方面,半角片假名另外定义在 U+FF65 到 U+FF9F,这是 1969 年由 JIS C 6220 (1987 年改称为 JIS X 0201) 制定的片假名用图形字符集,即可用单字节表示的片假名的遗留产物。半角片假名中,浊点和半浊点作为独立字符处理,因此"ガ"在半角中变为"ガ" (2 个字符),会影响字符计数。

片假名存在若干不同写法,成为实务上的注意点。例如"コンピュータ"和"コンピューター"、"サーバ"和"サーバー"这样,会因长音符号的有无而分成不同写法。规定技术文档样式的 JIS Z 8301 曾经设有"三音以上的词不在词尾加长音符"这一基准,但在 2019 年的修订中,这条省略基准本身被废止,改为依据 1991 年的内阁公告《外来语的表记》。内阁公告原则上把词尾的 -er / -or / -ar 写作长音符,同时也允许根据惯用予以省略。在实务中,2008 年微软从省略写法切换为加长音的写法被视为一个分歧点,而 2022 年的《公文写作的思路》未设省略规定,并对 -ty / -ry 这类以 y 结尾的词也表明了使用长音符的方针。如果是新决定表记规则,宜向加长音的一侧靠拢;如果要与既有数据混用,则在检索、比对之前插入把表记统一过来的处理,这样的判断较为稳妥。

从字符计数的角度来看,全角片假名和半角片假名都各算 1 个字符。不过在 UTF-8 中的字节数,全角片假名是 3 个字节,半角片假名也是 3 个字节。由于半角片假名的浊点和半浊点作为独立字符 (而非组合字符) 处理,视觉上的字符数与实际的计数结果可能不同。

这里容易搞错的是该使用哪种规范化形式。能把半角片假名归拢到全角的,只有伴随兼容分解的 NFKC 和 NFKD,用 NFC 或 NFD 则仍保持半角不变。实际把"ガ"用各形式规范化后:NFC 和 NFD 仍是 2 个字符,NFKC 是 1 个字符的"ガ",NFKD 则是"カ"加组合浊点的 2 个字符。若想统一为全角并数作 1 个字符,就需要选择 NFKC;而以为施加了 NFC 就能统一,这样的取错很容易发生。不过 NFKC 同时还会把全角英数字转为半角、把罗马数字转为英文字母的排列等,会广泛地压平字形,因此对于姓名和住址这类想保存输入字形的数据,安全的设计是保留原文,另外持有一份用于检索的规范化键。

分享这篇文章