最后更新:

日语文本基本规则 - 标点符号与排版规范指南

8 分钟阅读

无论是商务文档、Web 内容还是社交媒体帖子,撰写日语文本的场景多种多样。然而,对标点符号和记号的使用方法缺乏自信的人并不少见。掌握正确的表记规则,可以显著提升文章的可读性和可信度。本文将从 JIS X 4051 (日语排版处理要求) 的规格背景到实务中可用的正则表达式检查,系统解析日语文本的基本规则。文章字数确认请使用字符计数器。

关于日语文本的意外事实

日语是世界上罕见的"混合使用 3 种文字体系的语言"。平假名、片假名、汉字,加上现代日常使用的字母和数字。Unicode 15.1 中,与日语相关的 CJK 统一汉字超过 97,680 个,加上平假名、片假名和符号类,日语文本可使用的字符达到 10 万字规模。

日语标点符号的组合存在 4 种模式:"、。"(一般)、",."(学术论文)、"、."(部分理科论文)、",。"(几乎不使用)。2022 年文化审议会的建议中,公文正式推荐使用"、。"。

不过在学术领域,至今仍有使用西文式逗号与句点的情况。这源于明治时期引进西方句读法时产生的混乱。1906 年文部省的"句读法案"是最早的公开基准,但它并不具备强制力,于是各家出版社与学术机构各自形成了独立的惯例,并延续到今天。

标点符号的基本规则与历史背景

标点符号是决定文章节奏与意义分隔的重要要素。恰当地使用它们,读者就能毫不迷惑地理解文意。

日语标点符号的历史意外地短,古典文学中几乎不存在标点符号。标点符号普及是明治时代以后的事,随着活版印刷的普及才固定下来。表示句末的句号较早得到统一,而逗号方面,日式逗号与西文式逗号的并存则持续了很长时间。

符号名称用途示例
。句号表示句子结束今日は晴れです。
、逗号表示句中停顿朝起きて、顔を洗った。
・中点并列词语的分隔京都・大阪・名古屋
……省略号表示余韵或省略それは……難しい。
——破折号补充说明或换一种说法彼女——つまり妻——が言った。

逗号该打在哪个位置并没有明确的规则,不过在以下场面加入逗号会更易读。

逗号的打法因媒体而异。报社的风格指南倾向于每句控制在 2 至 3 个逗号,而法律文书为防止误读习惯多打。Web 内容中,当一句话超过 60 个字符时加入逗号可提高可读性。

全角与半角的区分

在日语文本中,全角与半角的区分左右着文章的品质。这个区别是日语特有的问题,源于 JIS X 0201 (含半角片假名的拉丁字符) 与 JIS X 0208 (全角字符) 这两套字符集长期并存的历史。

字符类型使用全角的场合使用半角的场合
数字竖排文章、惯用表达横排文章、数据、日期
字母固有名词的一部分一般英语单词、缩写、URL
片假名普通日语文本车站名显示、部分行业惯例
括号竖排文章横排文章、Web 文本
符号类句号、逗号冒号、分号、斜线

比较主要媒体的表记指南可以发现,共同通信社的《记者手册》原则上把数字定为半角,NHK 的《广播用语手册》则详细规定了汉数字与阿拉伯数字的区分。Web 媒体中的标准做法是以半角英文数字为基本,日语的标点则使用全角。全角空格原则上不使用,统一为半角空格。

直角引号与引号的用法

日语拥有自成体系的括号用法,需要按用途区分使用。

括号的嵌套以 2 层为可读性的极限。需要 3 层以上时,应当重新审视文章结构。同时要注意开括号与闭括号的对应关系不要错乱。

Web 文本与印刷物在括号的处理上并不相同,这一点也需要留意。印刷物的排版会在括号前后自动插入空隙,进行所谓的挤压排版处理,但 Web 浏览器没有这项功能。用 CSS 的 font-feature-settings: "halt" 或 text-spacing-trim 属性可以做部分应对,不过浏览器的支持状况目前仍然有限。

数字的表记规则

数字的表记方针,会因为文章是横排还是竖排而有根本差异。

场面推荐表记示例
横排的文章半角阿拉伯数字3 回、100 人、2025 年
竖排的文章汉数字三回、百人、二〇二五年
惯用表达汉数字一人ひとり、四季、七転び八起き
固有名词遵从原文六本木、四谷、三菱
概数汉数字数十人、百数十件

位数多的数字要加入逗号以便阅读 (例如 1,000,000)。小数点使用半角句点 (例如 3.14),不使用全角句点。另外在竖排的场合,正式做法是不用逗号做位数分隔,而是用汉数字写成"百二十三万四千五百六十七"这样的形式。

禁则处理与排版的技术背景

支撑日语文本显示质量的重要机制是"禁则处理"。JIS X 4051 (日语文档的排版方法) 规定了不能放在行首和行末的字符。

行首禁则字符包括各类闭括号以及句号、逗号等标点符号。因为它们一旦出现在行首,视觉上就会显得不自然、难以阅读。另一方面,行末禁则字符包括各类开括号——如果紧接开括号之后就换行,它与对应的闭括号之间距离过远,可读性便会下降。

Web 浏览器通过 CSS 的 word-break 和 line-break 属性控制禁则处理。指定 line-break: strict 会套用符合 JIS X 4051 的严格禁则处理;而 line-break: normal 则是宽松的禁则处理,允许小写假名 (ぁ、ぃ、っ 等) 出现在行首。印刷物的排版软件 (如 InDesign) 还能进一步自定义细致的禁则表,但在 Web 上只能依赖浏览器的实现,这一点需要注意。

Web 文本与印刷物在表记规则上的差异

Web 上的文本有着与印刷物不同的固有注意点。理解两者的差异,就能按媒体选用恰当的表记方式。

项目Web 文本印刷物
字符编码UTF-8 是事实上的标准有时仍残留 Shift_JIS
禁则处理依赖浏览器的 CSS 实现可用排版软件详细控制
括号的空隙无自动调整 (CSS 部分支持)排版软件自动做挤压处理
竖排支持可用 writing-mode: vertical-rl 实现标准即支持
字体依赖用户环境可用嵌入字体统一

Unicode 中日语特有字符的注意事项

字符码点正式名称用途
ーU+30FC片假名长音符号片假名长音 (コーヒー)
-U+2014EM DASH破折号 (补充说明)
―U+2015HORIZONTAL BAR横线、分隔线
−U+2212MINUS SIGN数式中的减号
・U+30FB片假名中点并列的分隔 (京都・大阪)
·U+00B7MIDDLE DOT西文的中点
〜U+301CWAVE DASH范围表示 (JIS 规格)
~U+FF5EFULLWIDTH TILDE范围表示 (Windows 惯例)

Unicode 中存在多个"外观相似而码位不同"的字符,容易在日语文本中引起混乱。若不能正确区分它们,检索和程序处理中就会出现意料之外的故障。

特别是"波浪号问题"非常有名。JIS X 0208 中波浪号 (U+301C) 是正式的,但 Windows 的 Shift_JIS 实现映射为全角波浪号 (U+FF5E),导致跨操作系统传输文本时可能出现乱码。在 UTF-8 环境中推荐使用 U+301C,不过出于与既有数据的兼容性考虑,仍有继续使用 U+FF5E 的情况。

常见失败模式

专业人士实践的表记技巧

  1. 制定风格指南:以团队或组织为单位撰写文章时,把表记规则形成风格指南文档,可以防止质量参差不齐。哪怕只把最基本的规则归纳成 10 条左右,例如"数字用半角"、"括号用半角"、"省略号连续 2 个",也已经很有效果。
  2. 用正则表达式检出表记不统一:借助文本编辑器的正则检索,可以一次性检出表记的摇摆。以下是实务中高频出现的模式。
    • 检出全角数字:[0-9]
    • 检出全角空格: 
    • 检出全角括号:[()]
    • 检出全角字母:[A-Za-z]
    • 波浪号不统一:[〜~] (U+301C 与 U+FF5E 的混用)
    • 省略号误用:\.{3}|・{3}
  3. 活用朗读功能:用操作系统的朗读功能 (macOS 的 VoiceOver、Windows 的讲述人) 听一遍文本,更容易察觉标点位置和句子节奏上的不自然之处。对长文校对尤其有效。
  4. CMS 中的日语文本管理:在 WordPress、Notion 等 CMS 中管理日语文本时,需要注意编辑器自动插入的全角空格和特殊字符。改用 HTML 编辑器模式直接确认,或在发布前转换为纯文本来检查表记摇摆,都是有效的做法。

总结

正确的日语表记能提升文章的可信度和专业印象。日语标点的组合有 4 种模式,公文推荐使用句号加逗号的组合;数字在横排时用半角、竖排时用汉数字;括号的嵌套控制在 2 层以内。这些基本规则一旦养成习惯,就不再需要每次查证。撰写后请使用字符计数器确认字数,养成检查表记统一性的习惯。

分享这篇文章