文本挖掘

运用统计学和语言学方法从大量文本数据中提取有价值的模式和知识的技术。综合运用分词、频率分析、共现分析、情感分析等方法。

文本挖掘 (text mining) 是从非结构化的自然语言文本中自动提取人工难以发现的模式和趋势的技术。它广泛应用于客户评论分析、社交媒体舆情调查、学术论文趋势把握、客服工单分类等一切积累了文本数据的领域。

文本挖掘的基本处理流程分为四个阶段。第一阶段是预处理,进行文本清洗 (去除 HTML 标签、符号正规化、统一表述差异)。第二阶段是分词,将句子切分为词语并标注词性。中文与英文不同,词与词之间没有空格分隔,因此 jieba、HanLP、pkuseg 等分词工具不可或缺。第三阶段是特征提取,使用 TF-IDF 或词向量将文本转换为数值向量。第四阶段是分析与可视化,应用聚类、分类、主题建模等方法。

频率分析是最简单的文本挖掘方法。统计文本中词语的出现次数,找出高频词。不过,"的"、"了"、"是"这类功能词 (停用词) 即使频率很高也不携带信息量,因此需要排除。频率分析的结果常以词云的形式可视化,能直观地把握文本整体的倾向。

共现分析用于检测特定词语在同一上下文中共同出现的模式。例如,在商品评论中"电池"和"续航"高频共现,就能看出电池续航是用户的关心所在。将共现网络可视化,词语之间的关联结构就会变得清晰。

情感分析 (sentiment analysis) 判断文本属于正面、负面还是中性。"这个产品太棒了"会被判为正面,"再也不会买了"会被判为负面。中文的情感分析中,反讽和委婉表达 (说"还行吧"是在称赞还是在表达不满) 依赖前后文脉,因此依靠词典和规则的方法容易产生误判。网络用语的更替速度很快,也让情感词典的维护始终跟不上实际用法的变化。

从字符计数的角度看,在文本挖掘的预处理阶段,字符数和词数的统计是基础数据。文档长度 (字符数) 作为分类模型的特征量很有效,在垃圾邮件检测中,"过短的邮件"或"异常长的邮件"都可以成为判别的线索。此外,N-gram 分析中会区分字符单位的 N-gram (字符 N-gram) 和词语单位的 N-gram (词语 N-gram),从字符数层面的模式到语义层面的模式进行多层次分析。

分享这篇文章