本节摘要:自然语言处理(NLP)是让计算机理解、解释并生成人类语言的方向,本质是让机器与一套演化了数万年、充满歧义与例外的人类符号系统对接。它的任务分理解与生成两大分支:前者包括分词、词性标注、命名实体识别、情感分析、文本分类等,后者包括机器翻译、对话系统、文本生成与数据到文本。技术上它走过规则语法、统计语言模型、词向量、循环网络、Transformer 与预训练大模型六级台阶,如今是商业化最广、离普通人最近的人工智能方向。
1954 年,乔治敦大学与 IBM 合办了一场机器翻译演示:一台计算机把几十句俄语译成了英语。主办方的乐观溢于言表,预言翻译问题几年内就会被彻底解决。随后二十年,资金涌向"给语言写规则"的路线,语言学家们埋头编写词典与语法,试图把人类语言变成一套可以穷举的条文。结果我们都知道了——语言里全是例外、歧义与语境,规则越写越多,系统却越写越脆。这条矿脉不是被愿望挖开的,它还得再冻上几十年。
规则时代的产物并非一无是处:专家手工编写的规则准确性高、可解释性强,今天一些封闭场景的关键系统仍在用。但代价同样明显——工作量巨大、难以覆盖所有语言现象、换个领域几乎无法迁移。拿工业史打比方,这是手工作坊阶段:全靠老师傅的锉刀,一件一件凿,产量上不去。
第一次解冻来自统计。研究者放弃"教机器语法",改用大规模语料库加统计学习:隐马尔可夫模型(HMM)、条件随机场(CRF)、支持向量机(SVM)从真实文本里数规律,N 元语法模型看着前几个词猜下一个词。统计方法的优点是能吃下海量数据、对语言的变异有适应性;短板是特征工程繁重,对上下文的理解依旧有限。它把 NLP 从作坊带进了煤矿——产量上来了,但挖的还是表层。
第二次解冻是词向量。Word2Vec、GloVe、FastText 把每个词映射成低维向量,语义相近的词在空间里坐标也相近。这一步的意义怎么强调都不过分:语言问题从此变成了几何问题,机器"计算意义"有了抓手。它还顺带解决了one-hot 表示的稀疏性顽疾。
💡 关键直觉:词向量把"词"变成了"坐标"。就像地质图把散落地表的矿石钉上经纬度——同一条矿脉的词自然聚成一簇,"国王"与"王后"的距离,远小于"国王"与"芹菜"。
随后是深度序列模型的十年。循环神经网络(RNN)自带记忆,适合逐词处理文本,却受梯度消失之苦,长句读到后面就忘了前面;长短期记忆网络(LSTM)与门控循环单元(GRU)用门控机制缓解了这个问题,把可处理的依赖距离拉长了一大截。卷积神经网络虽为图像而生,也在文本分类这类任务里证明了自己提取局部特征的本事。注意力机制则是关键一跃:模型在翻译每个词时学会"回头看"原文最相关的位置,长距离依赖问题被大幅缓解。
第三次解冻是 Transformer。它干脆扔掉循环结构,完全依靠自注意力机制,让序列中任意两个位置直接建立联系,训练可以大规模并行——这一下同时解决了"记得住"与"算得快"两件事。再往后,BERT、GPT 系列(GPT-2、GPT-3、GPT-4)、XLNet、RoBERTa、T5 等预训练语言模型登场:先在海量无标注文本上做"通识阅读",学到通用语言表示,再在具体任务的小数据上微调。"预训练加微调"由此成为 NLP 的主流范式。
⚠️ 常见坑:把"参数大"当成"理解深"。大模型记住了海量搭配习惯,未必拥有常识——遇到训练数据没覆盖的说法,它可能一本正经地编。工程上,生成类系统的输出必须留人工审核位。
NLP 的任务地图像一棵两叉树。理解这一叉(自然语言理解,NLU)要机器从文本里"读出"结构与含义;生成这一叉(自然语言生成,NLG)要机器把结构与数据"说成"人话。理解是生成的逆过程,但难度并不对称——读懂一份财报,比写好一份财报容易。
理解类任务自下而上搭了一串台阶。最底层是分词:英文天然有空格,中文没有,"我爱北京天安门"要先切成"我、爱、北京、天安门",切错一步后面全错。往上是词性标注(我是代词、爱是动词、北京是名词)、命名实体识别——从"史蒂夫·乔布斯于1955年出生在美国。"里抽出人名乔布斯、日期1955年、地名美国。再往上是句法分析与语义角色标注:"小明吃苹果"要解出主谓宾结构,"小明用筷子吃苹果"还要标出施事者小明、工具筷子、受事者苹果。应用层的典型任务包括情感分析("这部电影太棒了!"是积极,"服务态度很差。"是消极)、文本分类(新闻归类、垃圾邮件识别)与文本摘要(抽取式摘好句,生成式重写新句)。
生成类任务则是把结构化信息还原成语言。机器翻译是最有影响力的一个,经典架构是编码器—解码器:源语言先被压缩成中间语义表示,再由解码器展开成目标语言。对话系统把生成拆成三段——理解用户、管理对话状态、生成回复。文本生成覆盖新闻稿、营销文案、诗歌;数据到文本则把表格与数据库记录转成自然语言描述,财报快讯的自动播报就是典型。

把两类任务并排放,更容易看清输入输出的差别:
| 分支 | 任务 | 输入 | 输出 | 典型应用 |
|---|---|---|---|---|
| 理解类 | 命名实体识别 | 新闻文本 | 人名、地名、机构名、日期 | 舆情监控、知识图谱构建 |
| 理解类 | 情感分析 | 用户评论 | 积极、消极、中性 | 电商口碑分析、品牌监测 |
| 理解类 | 文本分类 | 文档 | 预定义类别标签 | 垃圾邮件过滤、新闻归类 |
| 理解类 | 文本摘要 | 长文档 | 简短摘要 | 快讯生成、报告速读 |
| 生成类 | 机器翻译 | 源语言文本 | 目标语言文本 | 谷歌翻译、百度翻译、DeepL |
| 生成类 | 对话生成 | 用户话语 | 系统回复 | 智能客服、聊天机器人 |
| 生成类 | 数据到文本 | 表格、数据库记录 | 自然语言描述 | 财报播报、天气快讯 |
⚠️ 常见坑:低估歧义。"苹果"是水果还是公司,靠语境才能裁决;同一句话换个上下文,词性、句法甚至褒贬都可能翻转。凡是假设"一句话只有一个确定含义"的系统设计,都会在真实语料上摔跟头。
NLP 的应用早已铺满日常生活的每个角落。机器翻译是门面:谷歌翻译、百度翻译、DeepL 服务着每天数以亿计的请求,技术底座正是序列到序列模型加注意力机制,再由 Transformer 架构推向高峰。
智能客服与聊天机器人是另一大块。银行、电商、电信的客服系统,核心链路是意图识别加槽位填充:先判断用户想干什么,再抽取关键信息,然后查知识库或走业务逻辑,生成回复。封闭业务内的问答已经很成熟;开放域闲聊则难在评估——对话没有唯一正确答案,"好不好"常常说不清。搜索引擎同样重度依赖 NLP:查询理解、文档排序、信息抽取、摘要生成环环相扣。舆情分析把情感分析、主题模型、命名实体识别打包,替品牌盯住社交媒体与新闻评论的风向。智能写作则用 GPT 系列的生成能力产出新闻稿、营销文案、产品描述与报告摘要。垃圾邮件过滤与内容审核这个"不出彩"的应用,反而是历史最久、最稳定的一块。
💡 关键直觉:预训练像通识教育,微调像岗前培训。基础模型读遍万卷书,新任务只需少量标注数据做"岗前指导"——这正是小团队也能用上顶尖语言能力的原因。
工程取舍上,我们建议按"任务封闭程度"排优先级:分类、抽取、审核、封闭域问答这类输出可控的任务,今天就能上;机器翻译、摘要这类输出半开放的任务,要配人工抽检;完全开放的自由生成,质量控制成本高,别轻易承诺"全自动"。瓶颈也要认账:高质量标注数据昂贵,低资源语言的技术水位明显落后;深度模型是黑箱,医疗、法律等关键领域不敢全信;训练数据里的偏见会被模型继承甚至放大,生成内容被滥用于虚假信息的风险,更是全行业必须面对的课题。
回答:训练方式决定分工。BERT 做的是"完形填空"式的双向编码,看前后文猜遮住的词,天然适合理解类任务,如分类、抽取、检索;GPT 是自回归生成,从左到右逐词预测下一个词,天然适合写作、翻译、对话。工程上的常见分工是理解选 BERT 系、生成选 GPT 系,两者底层都是 Transformer,只是"读书方法"不同。
回答:英文有空格替机器断句,中文没有。"研究生命起源"既该读成"研究、生命、起源",也可能被错切成"研究生、命、起源",切分不同意思全变。分词是中文 NLP 的第一道工序,它的质量直接决定词性标注、实体识别这些下游环节的上限。
语言这条矿脉已经开采到预训练的深层,但人类获取信息的另一条主干道是眼睛。下一节我们把镜头对准计算机视觉,看机器如何从上百万个像素里"看"出一个世界。