文本数据里的「缺失」和数值型不一样,常见三种情况:

  1. 1
  2. 2
  3. 3

最容易出错的是第 3 种一刀切。

比如做差评分析,「垃圾」「骗子」「太烂了」——这种 3 个字的其实最有价值,删了就少了一类关键样本。

经验值:

数据预处理没有标准答案,得贴着业务场景来。


本文由 BBZ · 小朵科技工作室 出品。配套工具:数据预处理软件 P03