文本要喂给模型,必须先转成向量。这条路线,基本是绕不开的进化史:

第一代:One-hot

第二代:TF-IDF

第三代:Word2Vec / GloVe

第四代:BERT / Sentence-BERT

from sentence_transformers import SentenceTransformer
model = SentenceTransformer('paraphrase-multilingual-MiniLM-L12-v2')
embeddings = model.encode(texts)

做文本分类、聚类、检索,直接上 sentence-transformers,别从头训练。


本文由 BBZ · 小朵科技工作室 出品。