最后更新:
日语文本基本规则 - 标点符号与排版规范指南
无论是商务文档、Web 内容还是社交媒体帖子,撰写日语文本的场景多种多样。然而,对标点符号和记号的使用方法缺乏自信的人并不少见。掌握正确的表记规则,可以显著提升文章的可读性和可信度。本文将从 JIS X 4051 (日语排版处理要求) 的规格背景到实务中可用的正则表达式检查,系统解析日语文本的基本规则。文章字数确认请使用字符计数器。
关于日语文本的意外事实
日语是世界上罕见的"混合使用 3 种文字体系的语言"。平假名、片假名、汉字,加上现代日常使用的字母和数字。Unicode 15.1 中,与日语相关的 CJK 统一汉字超过 97,680 个,加上平假名、片假名和符号类,日语文本可使用的字符达到 10 万字规模。
日语标点符号的组合存在 4 种模式:"、。"(一般)、",."(学术论文)、"、."(部分理科论文)、",。"(几乎不使用)。2022 年文化审议会的建议中,公文正式推荐使用"、。"。
不过在学术领域,至今仍有使用西文式逗号与句点的情况。这源于明治时期引进西方句读法时产生的混乱。1906 年文部省的"句读法案"是最早的公开基准,但它并不具备强制力,于是各家出版社与学术机构各自形成了独立的惯例,并延续到今天。
标点符号的基本规则与历史背景
标点符号是决定文章节奏与意义分隔的重要要素。恰当地使用它们,读者就能毫不迷惑地理解文意。
日语标点符号的历史意外地短,古典文学中几乎不存在标点符号。标点符号普及是明治时代以后的事,随着活版印刷的普及才固定下来。表示句末的句号较早得到统一,而逗号方面,日式逗号与西文式逗号的并存则持续了很长时间。
| 符号 | 名称 | 用途 | 示例 |
|---|---|---|---|
| 。 | 句号 | 表示句子结束 | 今日は晴れです。 |
| 、 | 逗号 | 表示句中停顿 | 朝起きて、顔を洗った。 |
| ・ | 中点 | 并列词语的分隔 | 京都・大阪・名古屋 |
| …… | 省略号 | 表示余韵或省略 | それは……難しい。 |
| —— | 破折号 | 补充说明或换一种说法 | 彼女——つまり妻——が言った。 |
逗号该打在哪个位置并没有明确的规则,不过在以下场面加入逗号会更易读。
- 主语较长时,打在主语之后
- 打在连接词之后 (例如"しかし、"、"したがって、")
- 打在并列词语之间
- 为防止误读,打在意义的分隔处
- 修饰语与被修饰语的关系变得含糊时打上
逗号的打法因媒体而异。报社的风格指南倾向于每句控制在 2 至 3 个逗号,而法律文书为防止误读习惯多打。Web 内容中,当一句话超过 60 个字符时加入逗号可提高可读性。
全角与半角的区分
在日语文本中,全角与半角的区分左右着文章的品质。这个区别是日语特有的问题,源于 JIS X 0201 (含半角片假名的拉丁字符) 与 JIS X 0208 (全角字符) 这两套字符集长期并存的历史。
| 字符类型 | 使用全角的场合 | 使用半角的场合 |
|---|---|---|
| 数字 | 竖排文章、惯用表达 | 横排文章、数据、日期 |
| 字母 | 固有名词的一部分 | 一般英语单词、缩写、URL |
| 片假名 | 普通日语文本 | 车站名显示、部分行业惯例 |
| 括号 | 竖排文章 | 横排文章、Web 文本 |
| 符号类 | 句号、逗号 | 冒号、分号、斜线 |
比较主要媒体的表记指南可以发现,共同通信社的《记者手册》原则上把数字定为半角,NHK 的《广播用语手册》则详细规定了汉数字与阿拉伯数字的区分。Web 媒体中的标准做法是以半角英文数字为基本,日语的标点则使用全角。全角空格原则上不使用,统一为半角空格。
直角引号与引号的用法
日语拥有自成体系的括号用法,需要按用途区分使用。
- 直角引号 (单层):用于对话、引用以及想要强调的词句。使用频率最高。
- 双层直角引号:用于书名、作品名,以及在单层直角引号内部还需要再加括号的场合。
- 圆括号:用于补充说明、注音假名,以及标示简称的正式名称。
- 方头括号 (隅付括弧):用于强调标题或项目名。在 Web 上也常被当作粗体的替代手段。
括号的嵌套以 2 层为可读性的极限。需要 3 层以上时,应当重新审视文章结构。同时要注意开括号与闭括号的对应关系不要错乱。
Web 文本与印刷物在括号的处理上并不相同,这一点也需要留意。印刷物的排版会在括号前后自动插入空隙,进行所谓的挤压排版处理,但 Web 浏览器没有这项功能。用 CSS 的 font-feature-settings: "halt" 或 text-spacing-trim 属性可以做部分应对,不过浏览器的支持状况目前仍然有限。
数字的表记规则
数字的表记方针,会因为文章是横排还是竖排而有根本差异。
| 场面 | 推荐表记 | 示例 |
|---|---|---|
| 横排的文章 | 半角阿拉伯数字 | 3 回、100 人、2025 年 |
| 竖排的文章 | 汉数字 | 三回、百人、二〇二五年 |
| 惯用表达 | 汉数字 | 一人ひとり、四季、七転び八起き |
| 固有名词 | 遵从原文 | 六本木、四谷、三菱 |
| 概数 | 汉数字 | 数十人、百数十件 |
位数多的数字要加入逗号以便阅读 (例如 1,000,000)。小数点使用半角句点 (例如 3.14),不使用全角句点。另外在竖排的场合,正式做法是不用逗号做位数分隔,而是用汉数字写成"百二十三万四千五百六十七"这样的形式。
禁则处理与排版的技术背景
支撑日语文本显示质量的重要机制是"禁则处理"。JIS X 4051 (日语文档的排版方法) 规定了不能放在行首和行末的字符。
行首禁则字符包括各类闭括号以及句号、逗号等标点符号。因为它们一旦出现在行首,视觉上就会显得不自然、难以阅读。另一方面,行末禁则字符包括各类开括号——如果紧接开括号之后就换行,它与对应的闭括号之间距离过远,可读性便会下降。
Web 浏览器通过 CSS 的 word-break 和 line-break 属性控制禁则处理。指定 line-break: strict 会套用符合 JIS X 4051 的严格禁则处理;而 line-break: normal 则是宽松的禁则处理,允许小写假名 (ぁ、ぃ、っ 等) 出现在行首。印刷物的排版软件 (如 InDesign) 还能进一步自定义细致的禁则表,但在 Web 上只能依赖浏览器的实现,这一点需要注意。
Web 文本与印刷物在表记规则上的差异
Web 上的文本有着与印刷物不同的固有注意点。理解两者的差异,就能按媒体选用恰当的表记方式。
| 项目 | Web 文本 | 印刷物 |
|---|---|---|
| 字符编码 | UTF-8 是事实上的标准 | 有时仍残留 Shift_JIS |
| 禁则处理 | 依赖浏览器的 CSS 实现 | 可用排版软件详细控制 |
| 括号的空隙 | 无自动调整 (CSS 部分支持) | 排版软件自动做挤压处理 |
| 竖排支持 | 可用 writing-mode: vertical-rl 实现 | 标准即支持 |
| 字体 | 依赖用户环境 | 可用嵌入字体统一 |
- 换行与段落:HTML 中要明确区分换行与段落。意义的分隔应使用段落标签。
- 字符编码:以 UTF-8 为标准,并且务必指定 meta charset。除有特别理由外,不使用 Shift_JIS 或 EUC-JP。
- 特殊字符的转义:HTML 中的
<、>、&要转换为实体引用。 - 空白字符:全角空格 (U+3000) 会成为意外的显示错乱之源,应使用半角空格 (U+0020)。
- 复制粘贴的对策:注意不要混入外观相同而字符编码不同的字符 (例如全角连字符与半角连字符)。
Unicode 中日语特有字符的注意事项
| 字符 | 码点 | 正式名称 | 用途 |
|---|---|---|---|
| ー | U+30FC | 片假名长音符号 | 片假名长音 (コーヒー) |
| - | U+2014 | EM DASH | 破折号 (补充说明) |
| ― | U+2015 | HORIZONTAL BAR | 横线、分隔线 |
| − | U+2212 | MINUS SIGN | 数式中的减号 |
| ・ | U+30FB | 片假名中点 | 并列的分隔 (京都・大阪) |
| · | U+00B7 | MIDDLE DOT | 西文的中点 |
| 〜 | U+301C | WAVE DASH | 范围表示 (JIS 规格) |
| ~ | U+FF5E | FULLWIDTH TILDE | 范围表示 (Windows 惯例) |
Unicode 中存在多个"外观相似而码位不同"的字符,容易在日语文本中引起混乱。若不能正确区分它们,检索和程序处理中就会出现意料之外的故障。
特别是"波浪号问题"非常有名。JIS X 0208 中波浪号 (U+301C) 是正式的,但 Windows 的 Shift_JIS 实现映射为全角波浪号 (U+FF5E),导致跨操作系统传输文本时可能出现乱码。在 UTF-8 环境中推荐使用 U+301C,不过出于与既有数据的兼容性考虑,仍有继续使用 U+FF5E 的情况。
常见失败模式
- 全角半角空格混用:同一文档中混用全角空格和半角空格,不仅破坏视觉统一感,还会在程序的字符串处理中引发意外行为。Web 文本中原则上应统一为半角空格。
- 括号配对错误:开括号与闭括号数量不匹配,或者种类不一致 (例如以单层直角引号开头却以双层直角引号收尾),是校对中最容易被遗漏的错误之一。长文中要有意识地确认括号的对应关系。
- 复制粘贴造成的字符错乱:从 Word 或 PDF 复制来的文本,可能混入外观相同而码位不同的字符 (例如全角连字符、半角连字符与减号)。建议养成粘贴后用文本编辑器确认的习惯。
- 省略号误用:正式写法是把"…"(U+2026) 并排两个写成"……"。用三个中点或三个句点来代替是错误的。
专业人士实践的表记技巧
- 制定风格指南:以团队或组织为单位撰写文章时,把表记规则形成风格指南文档,可以防止质量参差不齐。哪怕只把最基本的规则归纳成 10 条左右,例如"数字用半角"、"括号用半角"、"省略号连续 2 个",也已经很有效果。
- 用正则表达式检出表记不统一:借助文本编辑器的正则检索,可以一次性检出表记的摇摆。以下是实务中高频出现的模式。
- 检出全角数字:
[0-9] - 检出全角空格:
- 检出全角括号:
[()] - 检出全角字母:
[A-Za-z] - 波浪号不统一:
[〜~](U+301C 与 U+FF5E 的混用) - 省略号误用:
\.{3}|・{3}
- 检出全角数字:
- 活用朗读功能:用操作系统的朗读功能 (macOS 的 VoiceOver、Windows 的讲述人) 听一遍文本,更容易察觉标点位置和句子节奏上的不自然之处。对长文校对尤其有效。
- CMS 中的日语文本管理:在 WordPress、Notion 等 CMS 中管理日语文本时,需要注意编辑器自动插入的全角空格和特殊字符。改用 HTML 编辑器模式直接确认,或在发布前转换为纯文本来检查表记摇摆,都是有效的做法。
总结
正确的日语表记能提升文章的可信度和专业印象。日语标点的组合有 4 种模式,公文推荐使用句号加逗号的组合;数字在横排时用半角、竖排时用汉数字;括号的嵌套控制在 2 层以内。这些基本规则一旦养成习惯,就不再需要每次查证。撰写后请使用字符计数器确认字数,养成检查表记统一性的习惯。