做评论分析时,一个很常见的纠结:重复评论要不要去?

结论:看场景。

机械重复(完全一样的文字):一定要去。常见于刷评、凑字数、无意义回复。这种数据进模型只会拉低准确率。

近重复(差一两个字,比如「不错不错」「挺不错的」):建议去,保留 1 条即可。这种基本是同一波人刷的。

语义重复(说的事一样但表达不同):别去。这是真实的样本多样性,去了反而损失信息。

代码上,机械重复一行搞定:

df.drop_duplicates(subset=["comment"], inplace=True)

近重复稍微麻烦,得算相似度:

from difflib import SequenceMatcher
SequenceMatcher(None, a, b).ratio() > 0.9

一般电商评论去完重,数据量会少 10%-30%,正常。


本文由 BBZ · 小朵科技工作室 出品。配套工具:数据预处理软件 P03