词频分析实战:jieba + nltk 双引擎,中英文词频词性一站搞定
词频分析实战:jieba + nltk 双引擎,中英文词频词性一站搞定词频分析是 NLP 最基础也最实用的工具——看用户天天在聊什么、竞品文案高频用词、专业领域术语识别。但中文和英文要的工具完全不一样: 中文:必须先分词 → 用 jieb...
6 个标签
阅读全文 →
记录文本分析、自然语言处理、可视化领域的实战经验与工具心得
词频分析实战:jieba + nltk 双引擎,中英文词频词性一站搞定词频分析是 NLP 最基础也最实用的工具——看用户天天在聊什么、竞品文案高频用词、专业领域术语识别。但中文和英文要的工具完全不一样: 中文:必须先分词 → 用 jieb...
数据预处理:4 步把 10 万条脏评论变成可分析的干净语料老板们最常踩的坑:拿到 10 万条评论直接跑 LDA,跑出来全是无意义主题。 问题不在算法,在数据——脏数据里 30% 是 URL、@用户、表情、空行、重复行。垃圾进,垃圾出。 我们...
用 Python 词云图让所有字大小一致词云图默认根据词频调整字号——频次高的字大、频次低的字小。但实际场景中(签名墙、姓名拼图、Logo 文字),我们经常需要所有字大小完全一致。 本文教您 4 行核心代码搞定。 一、传统词云的问题直接用 ...