什么是大模型?
它不是聊天机器人,而是一台「文字接龙引擎」。从训练到推理,看它怎么学会、又怎么接话——全文无公式,8 分钟读完。
大模型最直观的印象是「会聊天的机器人」,但聊得自然只是表象。底层它只做一件事:根据上文,预测下一个词。要真正看懂它,得从两个阶段看——训练阶段它如何学会接话,推理阶段它如何开口。
01 · 核心机制:海量「文字接龙」
大模型最底层的任务只有一个:根据上文,预测下一个词(token)是什么。你输入「今天天气真」,模型内部会计算出概率最高的下一个词是「好」还是「热」。它不知道什么是天气,它只知道海量文本里,这个位置最常见的接法长什么样。
对答案 · 错了就调参
手里拿着「标准答案」——互联网上的海量文本。它把自己预测的词和原文下一个词逐一对比:错了,就微调内部网络参数;对了,就保持。见多识广,靠的是一遍遍对答案。
接话 · 顺着语感续写
没有标准答案。你问一句,它凭海量阅读练出的语感,从上万个候选词里挑概率最高的那个,一个字一个字续写下去——这就是推理,也叫生成。
02 · 人工神经网络(Transformer 架构)
现在的大模型几乎都基于 Transformer 架构,其中最核心的发明叫自注意力机制(Self-Attention)。处理「苹果」这个词时,模型不会只盯着它,而是扫描上下文里所有词,给每个词打分(权重)。同一个词,语境不同,重点就完全不同:
「我把苹果吃了」
「我」和「吃了」的权重极高——这里的苹果,是水果。
「苹果发布了新手机」
「手机」和「发布」的权重极高——这里的苹果,是公司。
靠这种全局扫描、动态打分,模型才能判断同一个词在不同语境下的具体含义——这就是它「读懂」句子的方式。
03 · 知识压缩:把万物变成「向量」
电脑不认识文字,只认识数字。大模型会把每一个词、每一个句子,都转化成一串高维度的浮点数(向量 / Embedding)。在模型的高维空间里(可能有几千维),「国王」和「王后」的位置离得很近,「苹果」和「橘子」离得很近——词义相近,向量就相近。
训练的本质,就是调整数万亿个参数,让这张「数学地图」无限逼近现实世界的逻辑关系。当模型学会这种向量运算时,它就具备了逻辑推理的雏形。
04 · 涌现能力:量变引起质变
当模型的参数量突破某个临界点(比如数百亿)时,会出现科学家也无法完全解释的涌现能力:它不再只是机械地接龙,而是在预测下一个词的过程中,自发衍生出阅读理解、逻辑推理、代码编写,甚至多步数学计算。
打个比方:只教一个学生背熟《新华字典》,但他背到极致时,居然自己学会了写诗和做微积分——这不是谁写代码赋予的功能,而是数据量堆叠出的「质变」。
05 · 人类对齐:从「博学」变得「好用」
预训练结束后,模型是一个「知识渊博但没礼貌」的杂学家:可能充满偏见,也不听从指令。于是要进行对齐(Alignment),让它从博学变得好用:
监督微调 · 学对话格式
给模型看大量「人类问答范例」,让它学会「你问我答」的对话格式——先教会它怎么好好说话。
人类反馈强化学习 · 学好坏
让模型生成多个回答,由人工标注员打分(哪个更安全、更有用),训练出一个「奖励模型」,再用强化学习让模型不断往「高分」方向优化。
这就是为什么现在的模型会拒绝回答危险问题——不是它「懂道德」,而是对齐阶段被调教出了这个方向。
那智能体又是什么?
一句话:大模型只会说,智能体会做。给这颗大脑装上手脚和记性,让它自己拆任务、调工具、跑完全程——那就是下一篇的主角。