工程师还需要理解 LLM 原理吗

内容管家 编程开发评论3字数 2538阅读8分27秒阅读模式
工程师还需要理解 LLM 原理吗

从学术象牙塔到 AI 教育一线

Sebastian Raschka 近年来在 AI 教育领域相当活跃。他最为人熟知的身份是《Build a Large Language Model (From Scratch)》一书的作者,此前曾是威斯康星大学麦迪逊分校(UW-Madison)统计学教授,如今则经营着自己的独立教育公司。

大多数开发者每天都在调用 AI 模型,但真正动手从零构建过的人寥寥无几。Sebastian 的书正是为了弥合这个差距而生——即使没有机器学习背景,也能通过这本书理解并亲手搭建一个 LLM。

本次访谈覆盖以下话题:

  • 从教授到独立教育者的转型路径
  • 为什么理解模型内部原理仍然重要
  • 软件工程师需要掌握多少 ML 知识
  • 推理模型的工作机制
  • 如何用 AI 代理提升编码效率
  • AI 时代如何保持自身价值

1. 离开学术圈:不是逃离,是主动选择

在 UW-Madison 期间,Sebastian 任职于统计学系,从事深度学习研究,同时教授机器学习和深度学习课程,还需要撰写科研基金申请、与生物、社会科学等应用领域合作。

高校工作责任繁杂、事务众多。Sebastian 表示自己其实很喜欢学校和同事,也非常热爱教学,但有几个因素最终促使他做出改变:

  • 精力分散:同时兼顾研究、基金撰写和教学,每一项都难以做到足够深入;
  • 内容重复:每年教授同样的课程,想象未来 30 年继续如此,令人望而却步;
  • 外部环境:COVID 时期是一个触发点。

2022 年,他加入纽约初创公司 Lightning AI,担任 Staff Research Engineer。三年左右,再次面临相似的选择节点,加上一些健康问题需要专注调养,他决定开启独立探索——成立自己的公司,以自雇形式开展多种 AI 相关合作与教育内容创作。

Sebastian 坦言,自己并不算"全职作家",实际工作涵盖 AI 项目合作、教育视频制作等多个方向。只是在某些阶段,著书确实会占据每天大量时间,包括书籍和博客文章。

工程师还需要理解 LLM 原理吗

2. 调 API 五行代码搞定,为什么还要懂模型内部?

调用现有 AI 接口完成编码任务,在当下已经是完全合理的标准工作流。但 Sebastian 认为,如果对模型运行原理有扎实理解,你能从中获得更多价值。

有了深层认知支撑,你就能提出更有针对性的问题,撰写更精准的提示词,并对 AI 的输出和方案保持更清醒的批判意识。

时间是有限的,不可能同时成为 Web 开发、Rust 专家、芯片设计和 LLM 专家。Sebastian 的建议是:选择性深入——在你真正高频使用的领域值得花时间去深入理解其原理,而不是面面俱到却样样稀松。

具体到 LLM 领域,理解其底层机制能带来以下实际好处:

  • 跟进新概念:AI 技术演进迅速,有基础认知才能快速理解新出现的名词和方法;
  • 把握能力边界:知道模型能做什么、不能做什么,避免在不对的场景投入错误期待;
  • 提升工作满足感:理解原理本身也是一种智识上的回报。

他举了一个近期案例:Anthropic 宣布为 Claude 生成内容添加水印时,业界出现大量质疑声——水印会影响文本质量吗?如何检测?如何去除?如果了解 LLM 在推理时如何生成下一个 token(包括随机采样过程),理解其水印机制就变得非常直接。

工程师还需要理解 LLM 原理吗

Sebastian 在博客杂志上发表过关于 Claude 水印技术的专题演讲,对这一话题做了详细拆解。

深入理解你的领域与底层工具

首先,尝试对你所在的软件工程细分领域保持深度理解。既然 AI 已经能帮你完成更多工作,这就解放了你的时间,可以用来学习该领域的最新发展动态,尝试不同的思路。

其次,尽量对你使用的底层工具——大语言模型、推理模型和(编码)智能体——建立扎实的理解。

工程师还需要理解 LLM 原理吗

你不需要像自己要开发这些工具那样做到极度深入。但既然这些"工具"在可预见的未来会一直存在,我认为学习其基础知识是一笔值得的投资。如前所述,这也能帮助你在这些工具演进时更轻松地跟上。

这和数学很像:如果你已经熟练掌握基础代数,理解微积分就更容易。如果你已经理解容器和分布式系统,学习 Kubernetes 就更容易。或者,如果你理解 JavaScript,学习 React 就更容易——例子不胜枚举。

推理模型是什么,为什么重要

其实,ChatGPT 内部的大语言模型本身就是一个推理模型。推理模型本质上是传统大语言模型的进化。这一趋势始于 2024 年 OpenAI 的 o1 模型,随后在 2025 年 1 月 DeepSeek R1 发布后变得真正流行并成为主流。所谓推理模型,在大语言模型语境下,本质上是一种利用所谓推理痕迹(即思维链)来"思考"问题的模型。简单来说,你可以把它想象成"大声思考"。

举一个例子:假设你作为一个人类在解决数学问题,想象你被允许使用草稿纸写下各个步骤,也可以回头修改和划掉错误的中间答案,直到得出最终结果。

这基本上就是推理模型的工作方式——它们更明确地利用这些中间步骤。在底层,这一能力通过一种额外的训练流程实现:基于可验证奖励的强化学习。除了这种额外的训练方法,还有推理缩放技术(如自我优化),有助于放大类似推理的行为。

在新书《Build A Reasoning Model (From Scratch)》中,作者同时涵盖了推理缩放和训练(使用基于可验证奖励的强化学习)。

工程师还需要理解 LLM 原理吗

顺便说一句,如今的大语言模型不再只是传统模型或推理模型,而是两者兼有,我们可以通过系统提示词控制推理行为。为什么以及如何实现这种引导——这恰恰是理解大语言模型底层原理会带来回报的又一个例子。

工程师还需要理解 LLM 原理吗

给后端工程师的 12 个月 AI 转型指南

对于刚接触 AI 的后端工程师,我的建议是:重新构建一个你以前做过的项目,但这次使用 AI 智能体来完成。(可以用:本地模型 + OpenCode、GPT + Codex,或者 Opus + Claude 等组合。) 这样做的好处是:第一步就能建立对这类智能体如何运作、如何提示的直觉。

项目实现并运行起来之后,下一步有趣的工作是提出改进或扩展。你可以让智能体实现一个你一直想做但没做的功能。你甚至可以让它审核&查验项目并提出你自己没想到的改进建议。或者,如果适用的话,让它做调研,了解其他人如何实现类似的系统——比如是否存在相关的开源框架,各自的优缺点是什么。

重要的是,仍然要运用软件工程的最佳实践,让智能体为功能、缺陷和效率等编写测试。

当你足够熟练后,关键就是扩大这些工作流程的规模——即并行使用越来越多的智能体,让智能体监督子智能体,等等。

15 年经验工程师如何保持竞争力

我认为这是一个学习新概念、拓宽视野、磨练判断力的好时机。AI 写越来越多的代码,意味着它解放了你,让你能够思考更大的图景。也就是说,你现在可以添加那些因时间限制原本不可行的功能。你可以加固代码库、编写更多测试。你可以通过实现改进来提高代码效率(甚至可以将某些部分移植到更适合特定任务的完全不同语言,比如把算法的关键部分从 Python 移植到 Rust)。

同样,现在也可以用不同的设计方案实现同一个项目,进行对比和基准测试。

总的来说,AI 可以带来大量实现改进的机会。

软件工程56条定律:一本可以放在案头的实用参考书

这本书涵盖软件工程领域的 56 条定律,横跨架构、人员、时间、质量、规模、代码与决策七个维度。每条定律都配有完整的讨论,包括:

  • 定律的具体内容
  • 定律的起源与背景
  • 适用场景
  • 在实际项目中的表现形式

部分章节还穿插了相关的延伸概念,例如"双披萨规则"(Two-Pizza Rule)、"眼镜蛇效应"(The Cobra Effect)以及"冒名顶替综合征"(Impostor Syndrome)。

工程师还需要理解 LLM 原理吗

这本书定位为一本案头参考书:遇到实际问题时可以随手查阅,快速找到对应的原则与思路。

两位重磅作序人

本书序言分别由以下两位行业领袖撰写:

  • Dr. Rebecca Parsons——Thoughtworks 首席技术官(Emerita)
  • Addy Osmani——Google Cloud AI 工程总监

此外,全书由来自 Google、Amazon、Uber、Oracle、Yelp、Nutanix 及 CodeScene 等公司的 20 位工程师与技术领袖参与审阅。

入手方式

获取本书

延伸阅读

 
内容管家

发表评论