Cập nhật lần cuối:

Mối quan hệ kỳ lạ giữa số nét Kanji và số ký tự - Một chữ có tới 84 nét

Khoảng 11 phút đọc

Chữ Kanji "靐" được tạo bằng cách xếp chồng ba chữ "雷" (sấm) có 39 nét. "𪚥" gồm bốn chữ "龍" (rồng) có 64 nét. Và "taito," được coi là chữ Kanji có nhiều nét nhất ở Nhật Bản, đạt tới 84 nét. Tuy nhiên, tất cả những chữ Kanji này đều chỉ được tính là "1 ký tự" trong bộ đếm ký tự. Chữ "一" chỉ có 1 nét và chữ "taito" có 84 nét đều là 1 ký tự như nhau. Bài viết này khám phá mối quan hệ giữa số nét Kanji và việc đếm ký tự, bao gồm số lượng Kanji được mã hóa trong Unicode và cách hoạt động của hệ thống ký tự dị thể.

Bảng xếp hạng Kanji có nhiều nét nhất

Về lý thuyết, không có giới hạn trên cho số nét Kanji. Vì có thể kết hợp các Kanji hiện có để tạo chữ mới, số nét có thể tăng không giới hạn. Tuy nhiên, nếu chỉ tính những Kanji có ghi nhận sử dụng thực tế, bảng xếp hạng như sau.

Nhiều Kanji có số nét cao mang cấu trúc gọi là "rigiji" - chữ được tạo bằng cách xếp chồng các thành phần giống nhau. "森" (mộc × 3 = 12 nét), "轟" (xa × 3 = 21 nét), "靐" (lôi × 3 = 39 nét) - nhân đôi hoặc nhân ba cùng một bộ thủ sẽ nhân số nét lên gấp bội. Những chữ ghép này thường mang nghĩa nhấn mạnh như "nhiều" hoặc "mãnh liệt," và phương pháp tạo chữ này đã tồn tại từ thời cổ đại.

KanjiSố nétCách đọcCấu tạoTrạng thái Unicode
𱁬84 néttaito, daito, otodo3 × mây + 3 × rồngĐã thu nạp (U+3106C, thêm vào Unicode 13.0)
𪚥64 néttetsu, techi龍 × 4Đã thu nạp (U+2A6A5)
𰻞58 nétbyanDùng để viết tên món mì "biangbiang" của tỉnh Thiểm TâyĐã thu nạp (U+30EDE, thêm vào Unicode 13.0)
靐39 néthyō雷 × 3Đã thu nạp (U+9750)
鬱29 nétutsuNhiều nét nhất trong Kanji thường dùngĐã thu nạp (U+9B31)

Chữ 84 nét thường được kể là đã từng dùng làm họ, nhưng câu chuyện đó không có cơ sở nào xác nhận được trong từ điển hay hồ sơ công. Về mặt mã hóa ký tự, chữ này đã được thu nạp vào Unicode 13.0 (2020) trong khối Mở rộng G tại vị trí U+3106C, nên nó hiển thị được như một ký tự đơn ở bất cứ nơi nào có phông chữ tương thích. Chữ "𪚥" 64 nét cũng vậy. Ngược lại, một chữ Kanji chưa được thu nạp vào Unicode thì không thể nhập hay lưu dưới dạng văn bản - chỉ có thể trình bày bằng hình ảnh.

Trong 2.136 Kanji thường dùng (jōyō kanji), "鬱" giữ kỷ lục với 29 nét. Nó được thêm vào danh sách jōyō trong lần sửa đổi năm 2010 (Thông báo Nội các số 2 năm 2010), và trong các ý kiến công chúng gửi về dự thảo sửa đổi, đây là chữ bị đề nghị loại bỏ nhiều nhất. Tuy nhiên, danh sách này không được chọn theo số nét: tiêu chí là mức độ cần thiết của một chữ trong văn bản hàng ngày. Đó là lý do một chữ 29 nét vẫn có chỗ trong danh sách.

Phân bố số nét của Kanji thường dùng

Xem xét phân bố số nét của toàn bộ 2.136 Kanji thường dùng cho thấy "độ phức tạp tiêu chuẩn" của các ký tự được sử dụng hàng ngày trong tiếng Nhật.

Khoảng nétSố chữTỷ lệKanji đại diện
1-4 nét1175,5%一, 二, 人, 大, 中, 日
5-8 nét57526,9%生, 出, 本, 学, 国, 物
9-12 nét84339,5%食, 海, 時, 動, 朝, 森
13-16 nét47822,4%話, 歴, 様, 線, 機, 橋
17-20 nét1135,3%題, 類, 議, 識, 観, 競
21+ nét100,5%欄, 露, 鶴, 籠, 驚, 鬱

Khoảng 9-12 nét chiếm nhiều nhất, khoảng 39,5% tổng số Kanji thường dùng. Số nét trung bình khoảng 10,4. Nói cách khác, Kanji được sử dụng trong văn bản tiếng Nhật hàng ngày có độ phức tạp trung bình khoảng 10 nét. Chỉ có 10 chữ đạt từ 21 nét trở lên: "欄," "躍," "露," "顧," "鶴" (21 nét), "籠," "襲," "鑑," "驚" (22 nét) và "鬱" (29 nét).

Cần lưu ý rằng các từ điển đôi khi chênh nhau một nét ở cùng một chữ. Các số liệu ở đây tính trên 2.136 chữ của danh sách jōyō (thông báo Nội các năm 2010), theo giá trị tổng số nét ghi trong thuộc tính ký tự Kanji của Unicode.

Đỉnh phân bố ở khoảng 9-12 nét là hệ quả của cách Kanji được tạo ra. Nhóm lớn nhất cho đến nay là các chữ hình thanh, ghép một phần mang nghĩa với một phần mang âm. Phần bộ thủ thường có 3 đến 4 nét, phần biểu âm khoảng 6 đến 8 nét, nên chữ ghép lại rơi đúng vào khoảng này. Chữ quá ít nét thì dễ lẫn vào nhau ("未" và "末," "己" và "已"), còn chữ quá dày nét thì nặng cả khi viết lẫn khi đọc. Kanji dùng hàng ngày tụ lại ở dải này là kết quả của cả cơ chế tạo chữ lẫn tính dễ dùng trên thực tế.

Nhiều nét nhưng cùng số byte - Sự bình đẳng của Unicode

Đây là điểm quan trọng nhất từ góc độ đếm ký tự. Dù Kanji có bao nhiêu nét, mối quan hệ giữa số ký tự và số byte vẫn không thay đổi.

KanjiSố nétMã UnicodeByte UTF-8Byte UTF-16
一1 nétU+4E003 byte2 byte
鬱29 nétU+9B313 byte2 byte
靐39 nétU+97503 byte2 byte
𪚥64 nétU+2A6A54 byte4 byte (cặp thay thế)

Tất cả Kanji trong khối CJK Unified Ideographs cơ bản (U+4E00-U+9FFF) đều chiếm 3 byte trong UTF-8 và 2 byte trong UTF-16, bất kể số nét. Chữ "𪚥" 64 nét nằm trong Extension B (U+20000-U+2A6DF), nên cần 4 byte trong UTF-8 và cặp thay thế (4 byte) trong UTF-16.

Tóm lại, số nét không ảnh hưởng đến số byte. Điều quyết định là ký tự được thu nạp vào khối Unicode nào. Kanji khối cơ bản chiếm 3 byte; Kanji khối mở rộng chiếm 4 byte. Sự khác biệt này được xác định bởi thời điểm ký tự được thêm vào Unicode, không phải số nét.

Sự tăng trưởng của CJK Unified Ideographs trong Unicode

Số lượng Kanji được mã hóa trong Unicode đã tăng đều đặn qua mỗi phiên bản. Như đã giải thích trong kiến thức cơ bản về Unicode, Unicode là tiêu chuẩn xử lý thống nhất tất cả hệ thống chữ viết trên thế giới, và việc mã hóa Kanji là một dự án đặc biệt quy mô lớn.

Phiên bản UnicodeNăm phát hànhCJK Unified Ideographs (tích lũy)Bổ sung chính
1.0.1199220.902Khối cơ bản (điểm khởi đầu của hợp nhất Hán tự)
3.0199927.484Extension A (6.582)
3.1200170.195Extension B (42.711)
5.2200974.382Extension C (4.149)
8.0201580.376Extension E (5.762)
10.0201787.870Extension F (7.473)
13.0202092.844Extension G (4.939)
15.1202397.668Extension H (4.192, trong 15.0) + Extension I (622)
17.02025101.984Extension J (4.298)

Cột tích lũy là tổng của khối cơ bản và các khối mở rộng (Extension A đến J). Nó tăng nhiều hơn một chút so với số lượng thêm của từng dòng, vì bản thân khối cơ bản cũng nhận thêm một vài chữ ở phần lớn các phiên bản. Còn một điểm nữa: mười hai ký tự nằm trong vùng tương thích vẫn được đối xử như chữ hợp nhất, nên cách đếm có tính chúng sẽ cho kết quả cao hơn mười hai ở mọi dòng. Đó là lý do cùng một phiên bản có nơi dẫn là "97.668" và có nơi dẫn là "97.680."

Từ khoảng 20.000 ký tự trong Unicode 1.0.1 (1992), CJK Unified Ideographs đã đạt khoảng 100.000 trong Unicode 17.0 (2025) - tăng gấp 5 lần trong hơn 30 năm. Tuy nhiên, Kanji sử dụng hàng ngày chỉ khoảng 3.000 trong tiếng Nhật và khoảng 3.500 trong tiếng Trung giản thể. Hơn 90.000 ký tự còn lại là Kanji hiếm dùng trong văn bản cổ điển, phương ngữ và các dạng dị thể lịch sử.

Bộ chọn dị thể (IVS) - Một ký tự, nhiều hình dạng

Điều làm cho việc đếm ký tự Kanji phức tạp hơn nữa là hệ thống Ideographic Variation Sequence (IVS). IVS phân biệt các hình dạng khác nhau (dị thể) của cùng một Kanji bằng cách thêm bộ chọn biến thể (U+E0100-U+E01EF) sau ký tự cơ sở.

Điểm dễ gây nhầm lẫn ở đây là sự khác biệt với các dạng chữ cũ. Các dạng phồn thể của "辺," tức "邊" và "邉," mỗi chữ đều có mã điểm riêng trong Unicode, nên chúng không cần đến IVS. Cái mà IVS xử lý là chuyện khác: những khác biệt về hình dạng chữ đã bị hợp nhất vào một ký tự tại một mã điểm duy nhất. Có hay không một nét nhỏ, nét cuối vẩy lên hay dừng lại - những chi tiết như vậy được chỉ định bằng cách đặt một bộ chọn sau ký tự cơ sở. Công việc hộ tịch và đăng ký tài sản phải ghi lại chính xác những chi tiết đó, và đó là chỗ IVS phát huy vai trò.

Khi sử dụng IVS, những gì trông như 1 ký tự trên màn hình thực tế tiêu thụ 2 mã điểm - ký tự cơ sở cộng bộ chọn biến thể. Đây là cùng cấu trúc được thấy trong đếm ký tự emoji, nơi một emoji đơn có thể gồm nhiều mã điểm.

Ký tự cơ sởBộ chọn biến thểHình dạng hiển thịSố mã điểmMục đích
辺 (U+8FBA)VS17 (U+E0100)Dị thể 1 của 辺2Tên trong hộ tịch
辺 (U+8FBA)VS18 (U+E0101)Dị thể 2 của 辺2Tên trong hộ tịch
葛 (U+845B)VS17 (U+E0100)Dị thể của 葛2Địa danh (Katsushika vs. Katsuragi)
祇 (U+7947)VS17 (U+E0100)Dị thể của 祇2Hình dạng chính xác của "Gion"

Một số công cụ đếm ký tự tính Kanji có IVS là "2 ký tự." Mắt người thấy 1 ký tự, nhưng chương trình nhận diện 2. Sự không khớp này gây ra vấn đề thực tế trong biểu mẫu nhập tên và hệ thống cơ sở dữ liệu địa chỉ.

Hạn chế Kanji trong tên và số ký tự

Tại Nhật Bản, các ký tự được phép dùng trong tên trẻ em bị giới hạn bởi pháp luật. Điều 50 Luật Hộ tịch quy định rằng "tên của con phải dùng những ký tự thông dụng và dễ hiểu," còn phạm vi cụ thể được nêu tại Điều 60 Quy tắc thi hành của luật này: các Kanji trong bảng Kanji thường dùng, các Kanji tại Bảng phụ lục 2 của cùng quy tắc (tức jinmeiyō kanji - Kanji dùng cho tên), katakana và hiragana. Một chữ Kanji ngoài phạm vi đó thì không được dùng trong tên, dù nó có ít nét đến đâu.

Bản thân số ký tự trong tên không có giới hạn pháp lý, nhưng tồn tại các ràng buộc thực tế từ hệ thống hộ tịch. Phạm vi ký tự mà hệ thống hộ tịch mỗi thành phố có thể xử lý khác nhau, và cách xử lý dị thể cũng khác nhau tùy địa phương.

Thông tin được ghi vào hồ sơ đang mở rộng ra chứ không thu hẹp lại. Luật Hộ tịch sửa đổi có hiệu lực từ ngày 26 tháng 5 năm 2025 đã bổ sung cách đọc tên người, viết bằng kana, vào các mục được ghi trong hộ tịch (Điều 13 của luật). Các hệ thống xử lý tên người nay phải mang theo cách đọc bên cạnh phần Kanji, nghĩa là có thêm một trường dữ liệu phải lưu và phải kiểm tra tính hợp lệ.

Số nét và giáo dục - Triết lý thiết kế Kanji theo cấp lớp

1.026 Kanji giáo dục được dạy ở tiểu học được phân bổ theo lớp. Bảng phân bổ (theo Hướng dẫn giảng dạy của Bộ Giáo dục) ấn định số chữ cho từng lớp như sau.

LớpSố chữTích lũy
Lớp 18080
Lớp 2160240
Lớp 3200440
Lớp 4202642
Lớp 5193835
Lớp 61911.026

Bảng phân bổ không nêu số nét, và tiêu chí sắp lớp là tần suất sử dụng cùng mức độ trừu tượng của nghĩa chứ không phải độ dày nét. Dù vậy, danh sách lớp 1 gồm toàn những chữ ít nét như "一," "二," "人," "山," "川," còn các chữ nhiều nét hơn như "臓" hay "警" nằm ở lớp 6: hai tiêu chí đó trên thực tế đi cùng nhau, vì chữ dùng nhiều nhất trong đời sống thường cũng là chữ có hình đơn giản nhất. Không dạy "鬱" (29 nét) ở lớp 1 - chữ này không thuộc bảng phân bổ tiểu học - là hệ quả tự nhiên của cách sắp xếp đó.

Số nét và nhập liệu viết tay - Thách thức thời đại số

Trên điện thoại thông minh và máy tính bảng, số nét làm thay đổi mức độ khó của việc nhập bằng chữ viết tay. Lý do nằm ở hình học: ô nhập trên màn hình có kích thước cố định, nên chữ càng nhiều nét thì khoảng cách giữa các nét càng bị bó lại. Hai nét vẽ cách nhau vài pixel có thể chập thành một, hoặc một nét bị đọc thành hai - và ngón tay thì rộng hơn đầu bút nhiều.

Điều đó không có nghĩa là chữ phức tạp thì vô vọng. Chữ nhiều nét lại mang nhiều thông tin để đối chiếu: thứ tự nét, hướng nét, cùng những tổ hợp bộ thủ mà chỉ vài chữ dùng đến, nên phần đầu của một chữ dày nét thường đã đủ hẹp phạm vi ứng viên. Chi tiết bên trong của từng engine nhận dạng không được công bố, vì vậy không thể nói chắc chữ nào sẽ vào hay ra ở đâu. Về mặt thực dụng: nếu một chữ liên tục không nhận đúng, hãy chuyển sang nhập bằng phiên âm hoặc tra theo bộ thủ thay vì viết lại thêm lần nữa.

Vấn đề này liên quan đến thiết kế xác thực đầu vào biểu mẫu. Khi biểu mẫu nhập tên chấp nhận viết tay, thiết kế UI tính đến khả năng nhận dạng sai - như hiển thị danh sách ứng viên hoặc cung cấp tùy chọn chuyển đổi phiên âm - là rất quan trọng.

Nhập bằng phiên âm thì thoát khỏi bài toán số nét hoàn toàn. Số lần bấm phụ thuộc vào số kana của cách đọc, không phụ thuộc độ dày nét của chữ: "鬱" 29 nét đọc là "utsu," tức hai kana, nên gõ nó cũng chẳng khác gì gõ một chữ hai nét có cùng cách đọc. Đó là lý do chuyển đổi từ phiên âm là con đường đáng tin cậy cho các chữ phức tạp.

Bài học thực tiễn từ số nét và đếm ký tự

Bài học thực tiễn chính từ mối quan hệ giữa số nét Kanji và số ký tự là "độ phức tạp trực quan và kích thước dữ liệu là hai thứ khác nhau." Giống như sự khác biệt giữa ký tự toàn chiều rộng và nửa chiều rộng, hình dạng bên ngoài của ký tự và cách biểu diễn dữ liệu không nhất thiết phải khớp nhau.

Khi thiết kế giới hạn ký tự cho biểu mẫu web, coi "1 Kanji = 1 ký tự" là thông lệ, nhưng tính đến Kanji có IVS và cặp thay thế khiến việc triển khai không đơn giản. Đặc biệt với biểu mẫu nhập tên, việc xử lý đúng ký tự dị thể ảnh hưởng trực tiếp đến trải nghiệm người dùng.

Kanji 84 nét và Kanji 1 nét đều bằng nhau là "1 ký tự" trong bộ đếm. Sự bình đẳng này là nguyên tắc thiết kế cốt lõi của Unicode - nền tảng để xử lý thống nhất tất cả hệ thống chữ viết trên thế giới. Vượt qua độ phức tạp vật lý của số nét, mọi ký tự đều được đối xử bình đẳng trong thế giới số. Đó vừa là vẻ đẹp, vừa đôi khi là sự phiền toái của Unicode.

Số nét là chỉ số quan trọng trong thư pháp và giáo dục, nhưng bị bỏ qua hoàn toàn trong đếm ký tự số. Chữ "一" 1 nét và chữ "鬱" 29 nét đều tính là 1 ký tự trong tin nhắn Slack và 1 ký tự trong tin nhắn LINE. "Sự dân chủ hóa số nét" này có thể nói là một trong những thay đổi lớn mà truyền thông số mang đến cho thế giới sử dụng Kanji.

Chia sẻ bài viết này