Stopword

Các từ xuất hiện thường xuyên bị loại trừ khỏi tìm kiếm và phân tích văn bản, như "a," "the," "is," và "in."

Từ dừng (stop words) là các từ có tần suất cao bị loại trừ khỏi phân tích văn bản và lập chỉ mục công cụ tìm kiếm. Trong tiếng Nhật, các trợ từ như の, は, が, を, に, で, and と thuộc loại này; trong tiếng Anh, các mạo từ, giới từ và động từ be như "a," "the," "is," "in," "and," and "of." Mặc dù các từ này xuất hiện cực kỳ thường xuyên, chúng mang ít thông tin ngữ nghĩa, khiến chúng trở thành nhiễu trong phân tích văn bản.

Mục đích chính của việc loại bỏ từ dừng là cải thiện độ chính xác tìm kiếm và giảm kích thước chỉ mục. Khi công cụ tìm kiếm toàn văn loại các từ tần suất cao khỏi chỉ mục, số bản ghi (postings) mà chỉ mục đảo ngược phải lưu giảm đi đáng kể. Theo số liệu đo thực tế trên kho ngữ liệu Reuters-RCV1 được nêu trong Introduction to Information Retrieval, giáo trình tiêu biểu về truy hồi thông tin, sau khi bỏ 150 từ có tần suất cao nhất, số bản ghi không kèm thông tin vị trí giảm khoảng 30%. Trong khai phá văn bản, tính TF-IDF (Tần suất thuật ngữ-Tần suất tài liệu nghịch đảo) sau khi loại bỏ từ dừng cho phép trích xuất chính xác hơn các từ khóa đặc trưng cho tài liệu.

Danh sách từ dừng thay đổi theo ngôn ngữ và trường hợp sử dụng. Các thư viện xử lý ngôn ngữ tự nhiên của Python có kèm danh sách từ dừng tiếng Anh chuẩn, nhưng số từ trong danh sách thay đổi theo thư viện và phiên bản, nên trong môi trường chưa cố định phiên bản phụ thuộc, cần kiểm tra danh sách thực sự được nạp trước khi dùng. Danh sách từ dừng tiếng Nhật được xây dựng dựa trên kết quả phân tích hình thái, tập trung vào trợ từ, trợ động từ và liên từ. Thêm từ dừng theo lĩnh vực cụ thể (ví dụ: "patient" trong ngữ cảnh y tế, "clause" trong ngữ cảnh pháp lý) có thể cải thiện thêm độ chính xác phân tích.

Tuy nhiên, việc loại bỏ từ dừng một cách đại trà cần thận trọng. Trong các trường hợp như "to be or not to be" nơi từ dừng mang ý nghĩa cốt lõi, hoặc "The Who" (tên ban nhạc) nơi danh từ riêng chứa từ dừng, việc loại bỏ gây mất thông tin. Tìm kiếm cụm từ ("New York," v.v.) cũng phụ thuộc vào thông tin vị trí từ dừng, khiến việc loại bỏ hoàn toàn không phù hợp.

Như chính giáo trình nói trên chỉ ra, phần lớn công cụ tìm kiếm web đã không còn dùng danh sách từ dừng: kỹ thuật nén làm giảm chi phí lưu bản ghi của các từ tần suất cao, và trọng số idf khiến các từ có tần suất cực cao gần như không ảnh hưởng đến xếp hạng, nên lợi ích của việc cố ý loại bỏ chúng đã trở nên nhỏ. Công cụ tìm kiếm và mô hình ngôn ngữ lớn phán đoán ý định truy vấn từ toàn bộ câu, bao gồm cả các từ chức năng. Các mô hình Transformer như BERT học ngữ cảnh từ toàn bộ câu bao gồm từ dừng, nên việc tiền xử lý loại bỏ từ dừng thực tế có thể phản tác dụng.

Liên quan đến đếm ký tự, từ dừng có đặc điểm chiếm tỷ lệ lớn trong tổng số ký tự văn bản. Trong tiếng Anh, số liệu đo trên kho ngữ liệu nói trên xác nhận rằng chỉ riêng 30 từ có tần suất cao nhất đã chiếm khoảng 30% tổng số token, và trợ từ tiếng Nhật cũng chiếm phần đáng kể trong số ký tự. Đối với nội dung giới hạn ký tự (tweet, mô tả meta, v.v.), việc giảm từ dừng một cách có ý thức cho phép đóng gói nhiều thông tin hơn vào số ký tự giới hạn.

Chia sẻ bài viết này