核心价值 Andrew Ng 在 The Batch 最新一期中系统阐述了 AI 工程化的核心能力框架,将"构建和部署 AI 应用"拆解为六个维度:LLM 基础、数据接地、智能体系统、评估驱动开发、生产运维、机器学习基础。这个框架的核心洞察是:AI 应用与传统软件的本质区别在于输出的不确定性——你不知道 LLM 会输出什么,也不知道监督学习模型会做出什么预测。正因为这种不确定性,构建 AI 系统是一个远比传统软件更迭代的过程——你无法事先规划完整路径,而是需要反复构建、检查、再决定下一步做什么。能"熟练地决定下一步做什么"的能力,是区分优秀 AI 工程师和普通工程师的关键。Ng 特别强调,评估驱动开发(Eval-Driven Development)是六个维度中最难掌握但最重要的技能——它让你能系统性地而非随机地推进项目,每次迭代都聚焦在最有成效的方向上。
对我的启发 这个框架有三个层次的直接应用价值:(1) 个人技能评估——用六个维度给自己打分:六个维度中,LLM 基础和机器学习基础是"知道即可"的层面,但评估驱动开发和智能体系统设计是"必须亲手做过才懂"的层面。如果你正在构建 AI 产品,可以问自己:我的开发流程中,有多少决策是基于系统化评估而非直觉?我是否有一个可以重复运行的评估体系来告诉我每次改动是进步还是退步?(2) 团队招聘——用这个框架设计面试问题:与其问"你用过哪些 LLM API",不如问"你上次构建的 AI 系统在什么情况下会失败?你是怎么发现这个问题的?你的评估体系是什么?"——这些问题直接对应框架中的"评估驱动开发"和"生产运维"维度。(3) 产品设计——理解不确定性是 AI 产品的第一性原理:很多 AI 产品失败不是因为技术不好,而是因为产品经理用确定性软件的思维设计 AI 产品。如果你在设计 AI 功能,第一个问题应该是"这个场景能容忍多大比例的输出错误?"而不是"AI 能做到多好?"
原文摘抄
核心价值 Farnam Street 提炼了区分真专家和模仿者的五个维度,将抽象的"判断力"转化为可操作的对话测试:(1) 深层追问能力——模仿者只能回答表面问题,当你追问细节、第一性原理或非标准场景时,他们没有好的答案;(2) 词汇适应能力——模仿者只能用学到的术语解释,无法根据听众调整表达方式,因为他们的理解是浅层的;(3) 面对不理解的反应——模仿者会因你听不懂而烦躁,因为他们更关心维持"专家形象";真正的专家则因你真诚的好奇而兴奋,他们热爱分享自己真正理解的东西;(4) 失败经历透明——专家能坦然说出自己走过的弯路,模仿者则害怕暴露错误会损害形象;(5) 能力边界意识——专家知道自己不知道什么,能清楚地告诉你"到这儿我懂,再往前我就没把握了",模仿者做不到。文章还特别提醒:科普作者和传播者常常被误认为专家——他们比普通人懂得多,但并非真正的专家,只是擅长清晰、生动地传达思想。
对我的启发 这五个维度可以立即用于三个场景:(1) 信息消费——判断你关注的人是真专家还是科普者:下次刷到一个"行业专家"的深度分析,用这五个维度快速校准——他能不能回答评论区里的追问?他有没有说过"这个我不确定"?他有没有分享过失败经历?(2) 自我检验——你在哪个领域是"模仿者"?坦白说,在 AI 这个快速发展的领域,我们大多数人处于"模仿者"和"专家"之间的某个位置。一个诚实的练习:选一个你自认为"懂"的 AI 概念(比如 RAG、Agent、RLHF),试着不用任何术语,用 500 字向一个完全不懂技术的人解释清楚。如果做不到,说明你的理解还停留在模仿层面。(3) 招聘面试——用这五个维度设计面试题:不要问"你用过 XX 技术吗",而是问"你上次用 XX 技术失败是什么时候?为什么失败?如果重来你会怎么做?"——这直接对应"失败经历透明"和"深层追问能力"两个维度。
原文摘抄
核心价值 Farnam Street 这篇短文精准回应了一个 AI 时代的关键问题:当 AI 可以一键生成文章时,为什么还要自己写?答案是:写作不是把已有的想法转录出来,而是通过写作发现自己并不知道自己在说什么。Paul Graham 的洞见是:"好的写作者不只是先想好,然后把想法写下来。好的写作者几乎总是在写作过程中发现新东西。"写作迫使你压缩想法——做得不好时,压缩会丢失洞察;做得好时,压缩会保留洞察并剔除垃圾。而压缩本身需要思考,这就是为什么写作如此困难,也如此有价值。在 AI 可以批量生产"平均水准"文字的未来,清晰思考将变得更加稀缺,因而更有价值。文章还指出,优秀写作者和普通写作者的关键区别在于:前者从读者想要什么开始,后者从自己想要说什么开始——就像走迷宫,前者从终点出发,后者从起点出发。
对我的启发 这个观点可以立即改变三个日常习惯:(1) 不要把 AI 当作"代写工具",而是"思维教练":如果你让 AI 生成一篇文章然后直接提交,你什么都没学到。但如果你先自己写一个草稿,然后让 AI 指出"哪些地方的论证不清晰""哪些概念没有解释清楚""哪里可以压缩",你就在通过写作提升思考。写作是过程,AI 是反馈,不是替代。(2) 在团队沟通中,先写后说:下次要做一个重要提案或汇报时,不要直接开会讲,先写出来。写的过程中你会发现哪些逻辑有漏洞、哪些论据不够、哪些表述模糊——这些在口头发言时很容易被掩盖过去。写完之后再开会,你的发言质量会显著提升。(3) 用"压缩测试"检验理解深度:如果你认为自己理解了某个复杂概念,试试用 200 字写出来。如果写不出来,说明你还没真正理解。这个测试比"我能跟人聊两句"诚实得多。
原文摘抄
核心价值 上海交大、浙大、复旦和微软小冰团队提出了一种全新的语音识别范式:让 LLM 以"编辑"而非"重写者"的角色来纠正转录错误。传统方案是让 ASR 引擎输出一次转录,再让 LLM 重写一遍——但重写可能引入新错误,尤其在专有名词(如人名 Megan vs Morgan)上。Agentic ASR 将纠错过程拆分为三个步骤:定位错误 → 理解用户意图 → 精准修复。这种"编辑式"方法在 GigaSpeech 上将语义错误率从 21.5% 降至 3.5%,在包含大量人名日期的 AISHELL-NER 上从 19.9% 降至 2.0%。这个框架的价值远超语音识别——它揭示了一个通用原则:对已有输出进行"精准编辑"比"重新生成"更可靠,因为重新生成可能破坏已经正确的部分。
对我的启发 这个"编辑优于重写"的原则可以迁移到多个场景:(1) AI 代码生成——让 AI 修改代码时,要求它"只改需要改的部分,保留所有已正确的内容",而不是让它重新生成整个文件。这可以显著减少 AI 引入的回归错误。(2) 文档协作——写文档时,不要用 AI 重新生成整个段落,而是精确指出"这一段需要改什么",然后让 AI 做最小化修改。保持对已正确内容的信任。(3) 个人反馈——给别人提修改建议时,学会"精准编辑"而非"推倒重来":不要说"你这段话得重写",而是说"第三句话的逻辑有问题,因为 X 和 Y 矛盾,建议改成 Z"。精准编辑同时传递了尊重(你大部分是对的)和帮助(这里可以更好)。
原文摘抄