做评论分析时,一个很常见的纠结:重复评论要不要去?
结论:看场景。
机械重复(完全一样的文字):一定要去。常见于刷评、凑字数、无意义回复。这种数据进模型只会拉低准确率。
近重复(差一两个字,比如「不错不错」「挺不错的」):建议去,保留 1 条即可。这种基本是同一波人刷的。
语义重复(说的事一样但表达不同):别去。这是真实的样本多样性,去了反而损失信息。
代码上,机械重复一行搞定:
df.drop_duplicates(subset=["comment"], inplace=True) |
近重复稍微麻烦,得算相似度:
from difflib import SequenceMatcher SequenceMatcher(None, a, b).ratio() > 0.9 |
一般电商评论去完重,数据量会少 10%-30%,正常。
本文由 BBZ · 小朵科技工作室 出品。配套工具:数据预处理软件 P03。