-
bbianji8 用户
Hugging Face Transformers 完全教程:从装环境到用预训练模型做中文 NLP 任务
适用人群:想调用大模型/预训练模型做文本分类、问答、翻译、生成的开发者。 读完你能做到:用 transformers 库在本地跑通中文情感分析、文本生成与问答,并理解模型/分词器/token 的概念。
一、原理背景
Hugging Face 是什么? 一个围绕开源模型的生态:Model Hub(模型仓库)、Datasets(数据集)、transformers(统一调用库)。你可以像装 npm 包一样下载别人训练好的模型。
三个核心对象:
- Model(模型):神经网络权重,如 BERT、GLM、Qwen。
- Tokenizer(分词器):把文本切成一个个 token 并转成数字 id,喂给模型。
- Pipeline(管道):把"分词→模型推理→后处理"打包成一行调用,最适合新手。
关键认知:模型只认数字。文本必须先 tokenizer 编码成 id 序列,模型输出 logits/概率,再解码回文本。
二、分步操作
步骤 1:安装
pip install transformers torch sentencepiece
# GPU 用户装对应 CUDA 版本的 torch,见 pytorch.org