前言
2018 年 6 月,OpenAI 发布了首个基于 Transformer 架构的语言模型 GPT(Generative Pre-trained Transformer),标志着大语言模型(Large Language Models, LLM)时代的到来。
笔者接触 LLM 的时间很晚。笔者第一次了解到人工智能技术大约是在 2020 年,了解的是 Siri——一款 Apple 公司推出的智能语音助手。那时,笔者对人工智能的认知还停留在语音识别和图像识别这类传统的、基于规则或特定任务的 AI 技术上。
直到 2023 年,ChatGPT 的出现彻底打破了这种刻板印象。它不再是那种只会回答"对不起,我没听懂"的死板程序,而是展现出了令人惊叹的上下文理解与生成能力。直至 2024 年,LLM 已经跃升为人工智能领域的核心基础设施,并在自然语言处理、代码生成、知识问答等多个领域展现出强大的降维打击能力。
彼时,笔者第一次尝试使用 ChatGPT 进行代码生成,切身体验了 LLM 在编程辅助方面的巨大潜力。通过与 ChatGPT 的自然语言交互,笔者能够快速生成复杂的代码片段、精准调试报错程序。即使是面对晦涩的算法问题,它也能像一位不知疲倦的资深工程师一样,提供详细的逻辑拆解和替代方案。这种革命性的交互式编程体验,让笔者深刻认识到:我们正在经历一场软件工程范式的重构。
9.11 > 9.9 ??
在大家惊叹于 LLM 无所不能的同时,也发生了一些令人啼笑皆非的"降智"事件。当时引发群众广泛讨论的一个有趣话题是:为什么询问 ChatGPT"9.11 和 9.9 哪个更大"时,它的回答往往是 9.11 更大?
人们尝试用不同的语气提问,甚至切换不同的语言,但早期的 LLM 几乎都会掉进这个陷阱。这一现象虽然看似荒诞,但却完美暴露了 LLM 底层运行逻辑的一个核心特征:它是一个"文字接龙"的高手,而不是一个内置了计算器的数学天才。
造成这个现象的原因主要有两个:
- 分词机制(Tokenization):LLM 看待世界的方式不是单个字母,而是"词元(Token)"。在切分 9.11 时,它可能会将其视为 9、.、11。在语言模型的潜意识里,整数 11 显然大于 9。
- 语料库的语义偏差:在人类互联网的海量文本中,带小数点的数字经常被用作"软件版本号"。从版本迭代的逻辑来看,v9.11 确实是 v9.9 之后发布的新版本。
这个经典的错觉引发了学术界和工业界对 LLM 逻辑推理边界的深刻反思,也成为了推动模型向"深度思考"和"强化学习"演进的催化剂。这让我们不禁要问:这些看起来像人的机器,到底是由什么构成的?
什么是 LLM?
大语言模型(Large Language Models, LLM),从本质上讲,是基于深度学习架构(目前绝对主流是 Transformer)构建的、拥有超大规模参数(通常在数十亿到数千亿级别)的神经网络。
如果用最通俗的话来解释,LLM 就是一个阅读了人类历史上几乎所有公开数字化文本的超级"概率预测机"。
它的核心工作原理非常基础:预测下一个词(Next Token Prediction)。当你输入"今天天气很",模型会基于它庞大的参数网络计算概率,得出下一个字是"好"的概率最高,于是输出"好"。
让它产生"智能"错觉的核心要素有三个:
- 大规模算力(Compute):成千上万张 GPU 并行计算。
- 海量数据(Data):维基百科、GitHub 代码库、电子书、论坛帖子。模型通过"阅读"这些数据,不仅学会了语法,还将人类社会的常识、逻辑和专业知识压缩到了自身的参数权重中。
- 惊人的参数量(Parameters):就像人类大脑的突触一样,上千亿个参数赋予了模型极高的维度来存储和关联信息。当规模达到一定程度时,模型甚至会展现出"涌现能力"(Emergent Abilities)——突然学会了在小模型上从未见过的逻辑推理和上下文学习能力。
LLM 的进化史:从破局到狂飙
回顾这段历史,技术的迭代速度令人眼花缭乱。
Transformer 横空出世(2017)
Google 发布了划时代的论文《Attention Is All You Need》。彻底抛弃了传统的 RNN 结构,引入了自注意力机制(Self-Attention),使得模型可以高度并行化训练,解除了算力封印。
GPT 与 BERT 的路线之争(2018)
OpenAI 推出基于解码器(Decoder)的 GPT-1,尝试用纯粹的生成式路线解决问题;同年 Google 推出基于编码器(Encoder)的 BERT,在阅读理解等判别任务上大放异彩。
Scaling Law 的胜利(2020)
OpenAI 发布拥有 1750 亿参数的 GPT-3,证明了"只要把模型做大,智能就会涌现"。无需针对特定任务微调,仅靠提示词(Prompt)就能完成翻译、问答。
ChatGPT 引爆全球(2022 年底)
OpenAI 将基于人类反馈的强化学习(RLHF)技术引入模型,打造出极度对齐人类意图的 ChatGPT。AI 第一次拥有了如此自然、流畅且富有逻辑的对话能力。
开源生态与多模态爆发(2023)
GPT-4 展现了惊人的多模态(视觉 + 文本)和推理能力。与此同时,Meta 开源了 LLaMA 模型,极大地降低了研究门槛,引发了开源大模型的"寒武纪大爆发"。
深度推理与系统演进(2024–2025)
行业不再单纯追求参数规模,而是转向追求极致推理成本(如 DeepSeek 提出的 MLA 与高效 MoE 架构)以及引入 System 2 Thinking,通过强化学习让模型在回答前进行长链路的反思与逻辑验证(如 OpenAI o1 系列与 DeepSeek-R1)。
它是如何被炼成的?(工作流程简述)
现代 LLM 的诞生通常需要经历三个核心阶段:
预训练(Pre-training)
模型像海绵一样吸收几万亿个词汇。这个阶段成本最高,它让模型拥有了世界知识,但此时的模型只是一个无差别的"接龙机器",不懂得如何与人对话。
监督微调(Supervised Fine-Tuning, SFT)
工程师提供大量高质量的"一问一答"示例(例如客服对话、代码修正)。模型通过学习这些示例,学会了"遵循人类指令(Instruction Following)"。
人类偏好对齐(RLHF / DPO)
让模型生成多个回答,由人类(或另一个更强的 AI)来打分排序,告诉模型"什么是好的,什么是安全的"。这一步赋予了模型价值观和边界感。
未来趋势展望
我们现在依然处于这场革命的早期阶段。站在当下展望未来,LLM 的发展正呈现出几个清晰的脉络:
- 从语言大模型走向"智能体"(AI Agents):LLM 不再只是一个被动回答问题的黑盒,而是将成为系统的"大脑"。它可以自主调用外部工具(API)、执行代码、操作浏览器,甚至多个 Agent 协同完成复杂的企业级任务。
例如,Microsoft 的 Copilot 已经在 Office 套件和 Visual Studio Code 中实现了基于 LLM 的智能助手,能够根据上下文自动补全代码、解释函数逻辑。现在的主流方向是让 LLM 直接调用外部 API 来完成任务,而不是仅仅生成文本。Agent 的核心就在于工具调用能力——不像传统的对话模型只能被动应答,Agent 可以直接读取你仓库中的全部代码,并在需要时自主调用特定工具来完成任务,无需你事先告诉它每一步该如何调用。
- 多模态的深度融合:视觉、听觉与文本将不再是割裂的模块。未来的模型将能直接理解一段长视频的内在逻辑,或通过实时语音进行带有情绪的深度交流。
目前,AI 已经具备处理和生成图片、视频和音乐的能力。这种能力更令公众感到新奇和震惊,因为它直接触及了人类创造力的核心,也引发了关于版权、原创性与艺术本质的深刻讨论。
AI 生成图片与视频
AI 生成图片的突破始于 2022 年 Stable Diffusion、Midjourney 和 DALL·E 2 的相继发布。这些模型通过文生图(Text-to-Image)技术,让用户只需输入一句话就能得到一张精美的图像。
2025 年,GPT-Image 系列的发布标志着 AI 图像生成进入了"规模化生产"阶段。与早期模型不同,GPT-Image 结合了 GPT 的语言理解能力和扩散模型的高保真生成能力,能够精准遵循复杂指令——不只是"画一只猫",而是"画一只坐在维多利亚风格沙发上的猫,穿着蓝色睡袍,光线从左侧窗户斜射进来,像荷兰黄金时代的油画"。这种细粒度的可控性让 AI 图像从"玩具"变成了真正的生产力工具。
而在视频领域,Sora(2024)、Veo 和 Kling(可灵)等模型正在颠覆短视频和影视创作的工作流——从数月的实景拍摄降低到几分钟的文本到视频生成,并且画面的物理一致性和长时序连续性在不断提升。
AI 创作音乐
AI 音乐生成同样经历了从实验室到消费级的跃迁。Suno 和 Udio 等工具让没有任何音乐训练的人也能输入一段文字描述(甚至哼唱一段旋律),随即获得一首完整的、有歌词、有编曲的歌曲。
这些模型的底层原理与语言模型一脉相承:将音频波形进行离散化分词(Tokenization),然后利用类 Transformer 架构进行自回归生成。有趣的是,一些研究者发现音乐 Token 的嵌入空间中已经自发地形成了和弦、调性等音乐理论概念——AI 并非在"随意拼凑音符",而是真正学到了音乐的语法。
不过遗憾的是,AI 生成的音乐目前还无法完全替代人类创作的情感深度和独特性。从个人体验和经验来说,AI 生成的音乐虽然和谐并且技术上无可挑剔,但往往缺乏那种"人味儿"——它可能会在某些细节上过于完美,反而失去了人类创作中那些微妙的瑕疵和不规则性,这些恰恰是艺术魅力的一部分。例如,最近很火的《念张师》等 AI 生成的歌曲,具有人们所认为的典型的"AI 音乐"特征:旋律流畅、编曲华丽,但在情感表达上却显得空洞,缺乏人类创作中那种独特的情感共鸣。这也可能是 AI 在音乐创作中展现出的过拟合现象——它过于依赖训练数据中的模式,反而无法创造出真正独特的作品。
- 端侧部署(Edge AI):随着量化技术(Quantization)的成熟,百亿级参数的强大模型正在被塞进电脑中,提供离线、零延迟且绝对保护隐私的个人专属 AI。
“我们创造工具,而后工具塑造我们。” LLM 已经证明了它不仅仅是下一代搜索引擎,而是新时代的电力系统。掌握并理解它的运作规律,将是我们在这个时代最重要的必修课。