Andrew Ng
身份与本文语境
Andrew Ng 即吴恩达。在本文语境中,他的核心身份首先是 AI Fund 创始人,其次是一次围绕 AI Agent 工程实践展开对谈的主角,也是整套 Agent 构建方法论的主要提出者。
对谈发生在 LangChain Interrupt 峰会上,Andrew Ng 与 LangChain 联合创始人 Harrison Chase 进行讨论。文中将他定位为 AI 教育与创业孵化的重要推动者,并将其观点集中在 Agent 构建方法、评估机制、语音交互工程、协议基础设施,以及团队能力判断上。
核心判断:关键不在提示设计,而在流程建模与执行速度
Andrew Ng 在本文中的一个总判断是:未来 AI 构建者的核心竞争力,不在提示设计本身,而在于把任务流程建模清楚,并以足够快的速度完成构建、评估、纠错和重组。
这意味着,真正拉开差距的不是“会不会写一个漂亮 prompt”,而是:
- 能否把现实业务流程拆成可执行步骤;
- 能否判断每一步应该由什么组件承担;
- 能否在系统失败后迅速定位是哪个环节出了问题;
- 能否在几分钟到几小时内,而不是几周到几个月内,完成一次有效迭代。
在他的表述里,很多团队的问题不是模型不够强,而是不会把流程搭起来,也不会在系统出错时决定“下一步该优化哪里”。
对 agenticness 的定义修正:不是标签,而是光谱
Andrew Ng 明确反对把“是不是 Agent”当成一个值得反复争论的语义问题。他指出,随着 Agent 概念走红,"agenticness" 一词被大量滥用,越来越多系统都被贴上 Agent 标签,但实际含义变得模糊。
他的修正是:Agenticness 应被理解为连续程度,而不是二元标签。
也就是说,一个系统并不是非黑即白地“要么是 Agent,要么不是 Agent”;更合理的理解是,不同系统具有不同程度的自主性。从几乎没有自主性,到具备较高自主性,都可以落在同一条光谱上。
他认为,只要系统具备一定程度的自主性,就可以纳入 agentic 系统的讨论范围。由此,社区不必再纠缠“它是否真正算 Agent”,而应直接回到更重要的问题:这个系统是否能有效解决实际问题。
这种定义修正的意义在于,它把讨论重心从概念归类转回工程落地。
对行业短板的判断:缺少把现实流程转化为 agentic 系统的中间技能
Andrew Ng 认为,当下行业并不只是缺更复杂的多 Agent 架构,真正更稀缺的,是一类“中间技能”:把现实世界中结构化、重复性的业务流程,转写成可执行的 agentic 系统。
他提到,很多商业流程其实并不神秘,往往是线性的,或者是在主线性流程里夹杂少量失败分支。典型例子包括:
- 填写表单;
- 在网页上搜索信息;
- 访问数据库检查是否涉及合规;
- 判断某个物品是否允许销售;
- 在多个系统间进行复制、粘贴、再次搜索、再次粘贴的循环操作。
这些流程本质上结构相对固定,十分适合 agent 化。但大量公司仍然不知道如何把这类流程变成 agentic 系统,尤其不知道:
- 应该用什么粒度拆任务;
- 某个原型效果不佳时应先修哪个步骤;
- 什么时候应该继续线性编排,什么时候需要更复杂的图结构或多代理协作。
他的判断是,当前构建者的主要问题仍集中在简单流程的建模与拆解,而不是高级架构不够花哨。换言之,行业最缺的不是概念热情,而是把结构化流程自动化的实操能力。
这与 Context Engineering、Skill Engineering、Agent Skills 等方向密切相关,因为它们本质上都在试图把“任务怎么做”编码为可执行、可复用、可评估的结构。
角色职责理解:Agent 系统需要模拟现实组织分工
Andrew Ng 进一步指出,现实业务流程通常横跨多个职能角色,例如合规、法务、人力资源等。每个角色承担不同职责,Agent 系统若想真正落地,就需要在流程中模拟这些角色的逻辑,并把它们衔接起来。
因此,构建 Agent 不只是“让模型回答问题”,而是要做系统管道设计:
- 哪些步骤需要顺序执行;
- 哪些步骤要调用检索、记忆、规则校验或外部接口;
- 哪些步骤适合模块化;
- 哪些错误是局部错误,哪些错误会导致整条流程失效。
他没有把某一种框架绝对化,而是指出是否使用 LangGraph、是否采用 Host 形式、是否拆成多个模块,都应由任务本身决定。边界在于:框架不是答案,任务结构才是答案。
对评估机制的强调:这是 Agent 工程里最大的隐性问题
Andrew Ng 将评估机制缺失视为当前 Agent 构建过程中最大的“看不见的问题”之一。他观察到,许多团队过度依赖人工评估:每次系统有调整,就由人重新查看输出是否正确。
这种做法的问题在于:
- 速度慢;
- 成本高;
- 难以持续迭代;
- 很难形成稳定的回归判断;
- 会让团队在定位失败步骤时缺少客观抓手。
因此,他主张尽快建立自动评估,哪怕一开始质量很粗糙。
支持快速、粗粒度自动评估
Andrew Ng 对评估系统的态度非常务实:评估不需要一开始就完美,应该先快速搭一个“哪怕很烂”的初级评估系统。
他给出的做法非常具体:如果某一步经常失败,就针对这一失败步骤写一个简单检测脚本,哪怕只覆盖 5 个输入样例也可以;再用一个简单模型去判断调整后是否发生回归。
这里的关键边界是:
- 评估系统不必完全替代人工;
- 评估系统首先承担的是重复性判断任务;
- 重点是让开发者获得快速反馈,而不是追求一次性建成完美 benchmark。
他理想中的状态,是开发者能借助 LangSmith 一类工具,在几分钟到几小时内做出判断,而不是拖很久才知道某次修改是否有效。
这套方法论体现出一种“真实数据、真实失败路径、快速回路”的工程观:评估不是论文式附属品,而是系统直觉形成的基础设施。
系统直觉:最宝贵的能力来自快速迭代中的触觉
Andrew Ng 认为,Agent 工程里非常关键的一种能力是“系统直觉”或“触觉型直觉”。这不是抽象天赋,而是在反复构建、观察失败、快速评估之后积累出来的判断力。
拥有这种直觉的人,能较快看出:
- 一个方向值不值得继续优化;
- 某个组件是否注定很难奏效;
- 失败更可能来自任务拆分、工具选型,还是评估缺失;
- 哪一步需要重写,哪一步只需轻微修补。
他甚至强调,没有这种触觉,一个团队可能花几个月优化错误组件;而有经验的人可能一眼就知道这条路走不通。