用語集

テキスト計測

文字エンコーディング

Unicode

世界中の文字を統一的に扱うための文字コード規格。14 万字以上の文字を収録する。

UTF-8

Unicode の可変長エンコーディング方式。Web の標準文字コードとして広く使われている。

Shift_JIS

日本語向けの文字エンコーディング。レガシーシステムで広く使われているが、現在は UTF-8 への移行が進んでいる。

ASCII

7 ビットで 128 文字を表現する文字コード規格。英数字と基本的な記号を収録する。

UTF-16

Unicode の 16 ビット単位のエンコーディング方式。JavaScript や Java の内部文字列表現に使用される。

EUC-JP

UNIX 系システムで広く使われた日本語文字エンコーディング。Extended Unix Code の日本語版。

ISO-2022-JP

電子メールで使われた日本語エンコーディング。エスケープシーケンスで文字集合を切り替える。

BOM (バイトオーダーマーク)

ファイル先頭に付与されるエンコーディング識別用のバイト列。UTF-8 では EF BB BF、UTF-16 では FF FE または FE FF。

コードポイント

Unicode で各文字に割り当てられた一意の番号。U+0041 (A) のように U+ に続く 16 進数で表記する。

サロゲートペア

UTF-16 で基本多言語面 (BMP) 外の文字を 2 つの 16 ビットコードユニットで表現する仕組み。

結合文字

直前の基底文字に結合して表示される Unicode 文字。ダイアクリティカルマークや濁点などが該当する。

エンディアン

マルチバイトデータのバイト順序。ビッグエンディアンとリトルエンディアンの 2 種類がある。

文字集合 (キャラクタセット)

特定の文字の集まりとその番号付けの体系。ASCII、ISO 8859、Unicode などが代表的。

GSM-7 エンコーディング

SMS で使われる 7 ビット文字エンコーディング。1 メッセージ 160 文字を格納でき、英数字と基本的な記号に対応する。

文字化け

テキストデータのエンコーディングとデコーディングの不一致により、本来の文字が意図しない記号や別の文字として表示される現象。

文字コード

文字とビット列の対応関係を定めた規則体系。文字集合と符号化方式の 2 層で構成される。

JIS (日本産業規格)

日本の産業製品に関する国家規格。文字コードの分野では JIS X 0208 や JIS X 0213 が日本語テキスト処理の基盤となっている。

可変長エンコーディング

文字によって使用するバイト数が異なる符号化方式。UTF-8 や Shift_JIS が代表例で、頻出文字を短いバイト列で表現することで効率を高める。

BMP (基本多言語面)

Unicode の最初の 65,536 個のコードポイントを含む領域。日常的に使われるほとんどの文字がここに収録されている。

文字種・文字体系

全角文字

固定幅フォントで半角文字の 2 倍の幅を占める文字。日本語のひらがな、カタカナ、漢字が該当する。

半角文字

固定幅フォントで全角文字の半分の幅を占める文字。ASCII 英数字や半角カタカナが該当する。

ひらがな

日本語の表音文字の一つ。やわらかい印象を持ち、助詞や活用語尾に使われる。

カタカナ

日本語の表音文字の一つ。外来語、擬音語、学術用語の表記に使われる。

漢字

中国で生まれた表意文字。日本語では常用漢字 2,136 字が日常的に使用される。

書記素クラスタ

人間が 1 文字と認識する最小の表示単位。複数のコードポイントで構成されることがある。

絵文字

Unicode に収録された絵文字記号。テキストコミュニケーションで感情や概念を視覚的に表現する。

ローマ字

日本語をラテン文字 (アルファベット) で表記する方式。ヘボン式と訓令式が代表的。

ゼロ幅スペース

表示幅がゼロの不可視文字 (U+200B)。改行位置のヒントやテキスト処理の制御に使われる。

ダイアクリティカルマーク

文字の上下に付加される補助記号。アクセント記号やウムラウトなど、発音の違いを示す。

表意文字

文字自体が意味を持つ文字体系。漢字が代表例で、CJK 統合漢字として Unicode に収録されている。

ZWJ (Zero Width Joiner)

幅ゼロの結合子。Unicode で複数の文字や絵文字を 1 つの表示単位に結合するために使われる制御文字 (U+200D)。

異体字

同じ意味・読みを持ちながら字形が異なる漢字のバリエーション。正字・俗字・旧字体・新字体などの関係を含む。

制御文字

画面に表示されないが、テキストの処理方法を指示する特殊な文字。改行、タブ、ヌル文字などが含まれる。

不可視文字

画面上に表示されないがテキストデータ内に存在する文字の総称。ゼロ幅スペース、双方向制御文字などが含まれる。

常用漢字

日本の文化審議会が定めた、日常生活で使用する漢字の目安となる 2,136 字の一覧。

文字種

テキストを構成する文字の分類。ひらがな、カタカナ、漢字、英字、数字、記号などのカテゴリ。

テキスト処理

トークン

テキストを処理する際の最小単位。自然言語処理や LLM では文字や単語とは異なる独自の分割単位を使用する。

文字列の切り詰め

テキストを指定された長さで切り詰める処理。表示領域やデータベースの制限に合わせて使用される。

改行

テキストを次の行に折り返す処理。CSS の word-break や overflow-wrap で制御する。

改行コード

改行を表す制御文字。LF (Unix)、CR (旧 Mac)、CRLF (Windows) の 3 種類がある。

Unicode 正規化

同じ文字の異なる表現を統一する処理。NFC, NFD, NFKC, NFKD の 4 形式がある。

トリム

文字列の前後の空白を除去する処理。多くのプログラミング言語で標準メソッドとして提供される。

エスケープシーケンス

特殊文字を表現するための文字列。バックスラッシュに続く文字で改行やタブなどを表す。

文字列結合

複数の文字列を連結して 1 つの文字列にする処理。+ 演算子やテンプレートリテラルなどで実現する。

部分文字列

文字列の一部を抽出する処理。slice、substring、substr などのメソッドで取得する。

文字列補間

テンプレートリテラルなどで変数や式の値を文字列に埋め込む処理。

パディング

文字列を指定した長さに揃えるために特定の文字を埋める処理。padStart や padEnd で実現する。

Base64

バイナリデータを ASCII 文字列に変換するエンコーディング方式。A-Z, a-z, 0-9, +, / の 64 文字を使用する。

パーセントエンコーディング

URL で特殊文字を %XX 形式の 16 進数で表現するエンコーディング方式。URL エンコーディングとも呼ばれる。

差分 (diff)

2 つのテキスト間の違いを検出・表示する処理。バージョン管理やコードレビューの基盤技術。

テキスト圧縮

テキストデータのサイズを削減する技術。gzip、Brotli、deflate などのアルゴリズムが使われる。

レーベンシュタイン距離

2 つの文字列間の編集距離。一方の文字列を他方に変換するために必要な挿入・削除・置換の最小回数。

あいまい検索 (ファジーマッチング)

完全一致ではなく、類似した文字列を検索する手法。タイプミスや表記揺れに対応できる。

フリック入力

スマートフォンのタッチスクリーンで、キーを上下左右にフリックして文字を選択する日本語入力方式。トグル入力より高速。

バリデーション

入力データが定められた形式・範囲・制約を満たしているかを検証する処理。文字数制限、文字種チェック、フォーマット検証などを含む。

プレースホルダー

入力フィールドに表示される仮のテキストで、ユーザーに入力内容の形式や例を示す。入力を開始すると消える。

大文字・小文字変換

アルファベットの大文字と小文字を相互に変換する処理。言語によって変換規則が異なり、文字数が変化するケースもある。

パース (構文解析)

テキストデータを構文規則に従って解析し、構造化されたデータに変換する処理。

チャンク

大きなデータやテキストを処理しやすい小さな単位に分割したもの。AI のトークン制限対策やストリーミング配信で使われる。

推敲・校正

文章の質を高めるために行う見直し作業。推敲は表現の改善、校正は誤字脱字の修正を指す。

OCR (光学文字認識)

画像やスキャンされた文書から文字を自動的に認識し、編集可能なテキストデータに変換する技術。

予測変換

ユーザーが入力した文字列から次に入力する単語や文を予測し、候補として提示する機能。

テキストエディタ

テキストファイルの作成・編集に特化したソフトウェア。文字数カウント、検索・置換、構文ハイライトなどの機能を備える。

原稿

印刷・出版・放送などのために作成されるテキストの元データ。400 字詰め原稿用紙が日本語の文章量の基準。

ソート (文字列の並べ替え)

文字列を特定の順序に並べ替える処理。言語や文化によって正しい順序が異なる。

プラットフォーム制限

文字数制限

プラットフォームやシステムが設定するテキスト入力の最大文字数。SNS、広告、フォームなどで適用される。

メタディスクリプション

HTML の meta description タグ。検索結果に表示される説明文で、120〜160 文字が推奨される。

タイトルタグ

HTML の title タグ。検索結果やブラウザタブに表示されるページのタイトルで、30〜60 文字が推奨される。

代替テキスト (alt 属性)

画像の代替テキスト。アクセシビリティと SEO に重要で、画像が表示できない場合に代わりに表示される。

スラッグ (URL スラッグ)

URL のパス部分に使われる人間が読める識別子。SEO とユーザビリティに影響する。

Open Graph

SNS でのリンク共有時に表示される情報を制御するメタタグプロトコル。Facebook が策定した。

X (Twitter) 文字数制限

X (旧 Twitter) の投稿は 280 文字まで。日本語・中国語・韓国語は 1 文字が 2 文字分としてカウントされる。

Instagram キャプション制限

Instagram のキャプションは 2,200 文字まで。ハッシュタグは最大 30 個まで使用可能。

SMS 文字数制限

SMS は 1 通 160 文字 (GSM 7-bit) または 70 文字 (Unicode/UCS-2)。長文は分割送信される。

ハッシュタグ

SNS の投稿にメタデータとして付与するキーワード。# 記号に続けて単語を記述し、投稿の発見性と分類に使われる。

キャプション

画像や動画に付随する説明テキスト。SNS では投稿の本文を指し、プラットフォームごとに文字数制限が異なる。

国際化

正規表現

自然言語処理

形態素解析

テキストを最小の意味単位 (形態素) に分割し、品詞や読みなどの情報を付与する処理。

トークナイゼーション

テキストをトークン (単語やサブワードなどの処理単位) に分割する処理。

ストップワード

検索やテキスト分析で除外される頻出語。「の」「は」「a」「the」など意味的に重要度の低い語。

N-gram

テキストを N 文字または N 単語ずつの連続部分列に分割する手法。検索やテキスト類似度の計算に使われる。

感情分析

テキストからポジティブ・ネガティブ・ニュートラルなどの感情極性を判定する処理。

TF-IDF

Term Frequency-Inverse Document Frequency の略。文書内での単語の重要度を数値化する手法。

固有表現抽出 (NER)

テキストから人名、地名、組織名などの固有表現を自動的に識別・分類する自然言語処理技術。

テキストマイニング

大量のテキストデータから統計的・言語学的手法を用いて有用なパターンや知見を抽出する技術。

要約

長い文章の要点を短くまとめる処理。抽出型と生成型の 2 種類があり、文字数制限下での情報伝達に不可欠な技術。

BPE (バイトペアエンコーディング)

テキストを頻出するバイトの組み合わせに基づいてサブワード単位に分割するアルゴリズム。GPT 等の LLM のトークナイザーとして広く採用。

自然言語処理 (NLP)

人間が日常的に使う言語をコンピュータで処理・理解・生成する技術の総称。

機械翻訳

コンピュータがある言語のテキストを別の言語に自動的に翻訳する技術。

タイポグラフィ

行間 (行送り)

テキストの行と行の間隔。CSS では line-height プロパティで指定し、可読性に大きく影響する。

フォントサイズ

文字の表示サイズ。CSS では px, em, rem, vw などの単位で指定する。

空白文字

スペース、タブ、改行などの不可視文字。テキスト処理やレイアウトで重要な役割を果たす。

合字 (リガチャ)

2 つ以上の文字を結合して 1 つのグリフとして表示する技法。fi, fl などが代表例。

カーニング

隣接する文字間の間隔を調整する技法。文字の組み合わせに応じて視覚的に均等な間隔を実現する。

吹き出し (フキダシ)

漫画やチャット UI でキャラクターの発言を囲む図形要素。限られたスペースに収める文字数の制約がデザインと密接に関わる。

ルビ (振り仮名)

漢字や外来語の読み方を示すために対象文字の上部に付される小さな文字。HTML では ruby 要素で実装する。

文字幅

テキスト表示における各文字の横方向の占有サイズ。全角と半角の区別や、プロポーショナルフォントでの可変幅が含まれる。

約物 (句読点・記号)

文章中で使われる句読点、括弧、引用符、感嘆符などの記号類の総称。言語や地域によって種類・用法・文字幅が異なる。

縦書き

テキストを上から下へ、行を右から左へ配置する書字方向。日本語・中国語で伝統的に使われ、CSS の writing-mode で実装する。

ワードラップ (行折り返し)

テキストが表示領域の幅を超えた際に、自動的に次の行へ折り返す処理。

引用符

テキスト中で引用、会話、強調などを示すために使われる記号。言語や地域によって形状が異なる。

ハイフンとダッシュ

テキスト中で単語の接続、範囲の表示、挿入句の区切りなどに使われる横線記号。

フォント (書体)

文字の視覚的なデザインを定義するデータセット。文字の表示幅や可読性に直接影響する。

インデント (字下げ)

テキストの行頭に空白を挿入して、段落の開始や階層構造を視覚的に示す書式設定。

字間 (トラッキング)

テキスト中の文字と文字の間隔。CSS の letter-spacing で制御し、可読性やデザインの印象に影響する。

データ形式

JSON

JavaScript Object Notation の略で、軽量なデータ交換フォーマット。人間にも機械にも読みやすい構造を持つ。

CSV

Comma-Separated Values の略で、カンマ区切りでデータを表現するテキスト形式。表形式データの交換に広く使われる。

XML

Extensible Markup Language の略で、データの構造をタグで記述するマークアップ言語。

YAML

YAML Ain't Markup Language の略で、インデントベースの人間に読みやすいデータシリアライゼーション形式。

Markdown

軽量マークアップ言語の一つ。プレーンテキストに簡易な記法で書式を付与し、HTML に変換できる。

HTML エンティティ

HTML で特殊文字を表現するための文字参照。& で始まり ; で終わる記法。

MIME タイプ

ファイルやデータの種類を識別するための標準的な分類方式。type/subtype の形式で表現される。

QR コード

2 次元バーコードの一種。最大 7,089 桁の数字または漢字約 1,800 文字を格納でき、誤り訂正機能を持つ。

SSID

Wi-Fi ネットワークの識別名。最大 32 バイトで、接続先を区別するためにルーターに設定する文字列。

圧縮率

データ圧縮において、元のデータサイズに対する圧縮後のサイズの比率。テキストデータは一般に 60〜80% の圧縮率を達成できる。

エントロピー (情報量)

情報理論における不確実性の尺度。テキストのエントロピーが高いほど予測が困難で圧縮しにくい。

セキュリティ

アクセシビリティ