很多同学觉得自动摘要很高深,要 BERT、要 GPT。其实简单场景用老办法就够。
TextRank 不光能提关键词,还能做摘要:
from textrank4zh import TextRank4Sentence tr4s = TextRank4Sentence() tr4s.analyze(text=text, lower=True, source='all_filters') summary = '。'.join([s.sentence for s in tr4s.summary(limit=3)]) |
原理跟关键词版一样,只是节点从词变成了句子,边是句子之间的相似度。
效果:
- 新闻稿:勉强能用,信息密度高
- 评论区:不太行,每条评论本身就很短
- 长文章 / 报告:效果最好,3 句话能讲清楚结构
更进阶的就用 HuggingFace 的预训练摘要模型,中文推荐:
imxly/t5-pegasus-small(轻量)uer/pegasus-chinese(中等)xianyu/bart-large-chinese(重但效果最好)
客户要「智能摘要」功能,先用 TextRank 跑一版 demo,大多都满意了再上深度学习。
本文由 BBZ · 小朵科技工作室 出品。