BlackHalo logo
Published on

大语言模型奖励专业知识

Authors
  • Name
    MaxMussio
    seangoedecke.com
数学家与AI对话的抽象插画
头图来源: 来源页面

核心论点:专业知识是提示的关键技能

作者开篇回顾了2010年代的技术环境:如果一个人存在技术短板(比如不会写CSS),只能依赖同事帮助或祈祷网上恰好有现成答案。如今,大语言模型让每个人都能通过委托任务成为“通才”。正因如此,许多人认为使用LLM不需要任何技能——既然大家面对的是同一个模型,新手和“提示专家”理应获得相同结果。

作者明确反驳了这一观点。他认为提示工程中最重要的技能恰恰是目标领域的专业知识。为了说明这一点,他引用了数学家陶哲轩与ChatGPT讨论雅可比猜想反例的对话。作者感叹:“这不是我平时对话的那个ChatGPT!”即使给他无限量的token,他也无法达到陶哲轩的对话深度。

陶哲轩对话中的观察

作者从陶哲轩的对话中提炼出几个关键特征:

  • 陶哲轩的消息非常简短且直击要点,他不逐点回应模型,只针对核心内容。
  • 模型输出也远比普通人对话时简洁,因为陶哲轩通过信号传递,让模型进入“与数学家对话”模式,而非“向业余者解释”模式。
  • 当模型回答看起来有误时,陶哲轩会委婉推回,例如说“这比我预期的更复杂”,而不是直接反驳。
  • 陶哲轩自己会做出跳跃性思考和提议,几乎从不采纳模型关于下一步方向的建议。

技巧背后的真正关键

作者强调,仅靠模仿这些表面技巧,无法在数学问题上获得陶哲轩级别的效果。真正核心在于理解数学本身:从模型的多段回复中提取相关思想、提出替代方法或表述、识别“看起来不对劲”的地方。陶哲轩之所以能如此高效,是因为他本身就是世界级数学家。

作者承认陶哲轩的数学能力远超自己的编程能力,但这一原理同样适用于他的日常工作。如果对代码库有深入理解,就能比毫无熟悉度时更有效地驱动LLM。拥有自己的解决方案直觉后,你可以说“不,这里应该更简单”“我们不是已经做过X了吗”或“能否用我们熟悉的术语表达这个问题”。

具体知识胜过通用原则

作者联系到自己此前关于系统设计的观点:系统设计问题主要由具体细节主导,而非通用原则。虽然两者都有用,但他更愿意熟悉代码库,而不是拥有对软件系统的深度通用理解。在陶哲轩的对话中,他提出了大量具体问题,如“X在这里有效吗”“给定Y和Z,为什么是A”。作者无法就雅可比猜想提出这些问题,但可以对自己在GitHub负责的系统提出类似问题。

专业知识的实际价值

作者总结道:没有领域知识时,你可以依赖LLM至少得到一些结果,这并非坏事。但拥有领域知识时,你能通过强力引导,从同一个LLM中榨取多得多的价值。大多数人需要混合使用这两种方式,因为我们在某些领域有专长,在其他领域则没有。

这一观察暗示,即使模型能力持续增强,人类专业知识仍将保持价值。对许多任务而言,瓶颈在于人类而非模型——困难的部分在于向模型精确传达人类想要的解决方案类型。信息已经“存在于模型中”,但需要非常聪明的人才能将其提取出来。

后续讨论与回应

文章发布后在Hacker News上引发大量评论。作者补充说明:一些评论者分享了专业知识如何帮助自己、缺乏专业知识如何造成困扰的个人经历;另一些评论者认为观点合理,但对此持谨慎态度——因为这一观点恰好安慰了人们“自己仍有价值”的心理。作者认同这种怀疑,但推测等到学界系统研究这一现象时,技术格局可能又已改变。

还有评论者指出OpenAI的数学提示本身就不专业,因此专业知识并非必需。作者回应:OpenAI确实拥有一支专家数学家团队,负责检查和筛选模型提出的发现,目前这一步骤无法跳过。

结语

文章最终落脚于一个实用建议:在大多数工作场景中,提升领域专业知识比追求提示技巧更能提高LLM使用效果。随着模型越来越强,人类专家的角色可能从“执行者”转变为“引导者”和“评判者”,但这一角色依然不可或缺。

原标题:LLMs reward expertise。 HN 原始发布时间:2026年8月4日星期二。当前记录为 1325 分、552 条评论。

阅读原文 · 查看 HN 讨论