Hugging Face Transformers 完全教程:从装环境到用预训练模型做中文 NLP 任务

适用人群:想调用大模型/预训练模型做文本分类、问答、翻译、生成的开发者。 读完你能做到:用 transformers 库在本地跑通中文情感分析、文本生成与问答,并理解模型/分词器/token 的概念。

一、原理背景

Hugging Face 是什么? 一个围绕开源模型的生态:Model Hub(模型仓库)、Datasets(数据集)、transformers(统一调用库)。你可以像装 npm 包一样下载别人训练好的模型。

三个核心对象

  • Model(模型):神经网络权重,如 BERT、GLM、Qwen。
  • Tokenizer(分词器):把文本切成一个个 token 并转成数字 id,喂给模型。
  • Pipeline(管道):把"分词→模型推理→后处理"打包成一行调用,最适合新手。

关键认知:模型只认数字。文本必须先 tokenizer 编码成 id 序列,模型输出 logits/概率,再解码回文本。

二、分步操作

步骤 1:安装

pip install transformers torch sentencepiece
# GPU 用户装对应 CUDA 版本的 torch,见 pytorch.org

步骤 2:用 pipeline 跑中

🔒 付费文档

支付 5 积分后即可解锁全部内容