- Published on
DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试中取得 89% 高分
- Authors
- Name
- tosh
- arcprize.org
模型概述与关键结果
DeepSeek V4 Flash 0731 是 DeepSeek 于 2026 年 7 月 31 日发布的推理模型变体。在 ARC-AGI 基准测试中,该模型在最大推理努力(Max 变体)下取得了 89.0% 的准确率(ARC-AGI-1 半私有测试集),每任务成本仅 0.02 美元。在更难的 ARC-AGI-2 半私有测试集上,Max 变体达到 61.4%,每任务成本为 0.04 美元。ARC-AGI 基准旨在评估 AI 的抽象推理能力,要求模型从未见过的视觉模式中归纳规则并完成图形变换。
推理变体性能对比
DeepSeek V4 Flash 0731 提供了三种推理变体:Max、High 和 Low,分别对应不同的计算预算和推理深度。
- Max 变体:在 ARC-AGI-1 上准确率 89.0%,ARC-AGI-2 上 61.4%。
- High 变体:ARC-AGI-1 准确率 87.0%,ARC-AGI-2 准确率 56.0%。
- Low 变体:ARC-AGI-1 准确率 84.0%,ARC-AGI-2 准确率 46.0%。
从数据可以看出,即使降低推理努力,模型在 ARC-AGI-1 上仍保持较高水平(84%),但在 ARC-AGI-2 上性能下降明显(46%),说明后者对推理深度要求更高。ARC-AGI-2 旨在增加任务难度,减少过拟合可能性,因此区分度更大。
任务级通过率分析
文章中提供了 ARC-AGI-1 公开评估(400个任务)和 ARC-AGI-2 公开评估(120个任务)的逐任务通过/失败结果。
ARC-AGI-1 公开评估
在 400 个任务中,Max 变体通过了绝大多数任务(约 95% 以上),失败任务主要集中在少数几个 ID 如 0d87d2a6、1acc24af、212895b5、25094a63、73ccf9c2、8b28cd80、8fbca751、d017b73f、da515329、f3b10344 等。这些任务可能是模型难以处理的边缘案例,或是需要复杂推理的组合模式。
ARC-AGI-2 公开评估
在 120 个任务中,Max 变体通过了约 60% 的任务(73 个通过,47 个失败)。失败任务包括 0934a4d8、13e47133、16b78196、20a9e565、21897d95、269e22fb、2b83f449、2d0172a1、3a25b0d8、3dc255db、446ef5d2、4c416de3、4c7dc4dd、4e34c42c、5545f144、581f7754、62593bfd、6ffbe589、78332cb0、7b80bb43、800d221b、8698868d、88bcf3b4、88e364bc、8b7bacbf、9bbf930d、a25697e4、a32d8b75、abc82100、b9e38dc0、d35bdbdc、da515329、de809cff、dfadab01、e12f9a14、e3721c99、f560132c、faa9f03d 等。值得注意的是,部分任务如 135a2760、136b0064、16de56c4、1818057f、1ae2feb7、247ef758、2ba387bc、31f7f899、35ab12c3、36a08778、38007db0、53fb4810、58490d8a、58f5dbd5、5961cc34、65b59efc、67e490f4、6e453dd6、8698868d、898e7135、8f215267、8f3a5a89、981571dc、9aaea919、a251c730、a395ee82、a6f40cea、aa4ec2a5、b10624e5、b5ca7ac4、b99e7126、bf45cf4b、c4d067a0、d59b0160、d8e07eb2、db0c5428、db695cfb、e8686506、f931b4a8 等在所有变体下均通过,说明这些任务相对简单或模型对它们有稳健的泛化能力。
成本效率与意义
DeepSeek V4 Flash 0731 在 ARC-AGI-1 上以每任务 0.02 美元的成本达到 89% 准确率,这在同类模型中极具竞争力。相比之下,许多大型模型需要更高的推理成本才能达到类似水平。该模型在 ARC-AGI-2 上的表现也表明,尽管任务难度增加,成本仅翻倍至 0.04 美元,但准确率下降幅度合理(从 89% 降至 61.4%)。这种成本效益使其成为研究和实际应用中的有力候选。
ARC-AGI 基准测试由 ARC Prize 组织,旨在推动能够解决抽象推理任务的 AI 系统发展。DeepSeek V4 Flash 0731 的结果表明,基于大规模语言模型和推理加速技术的模型在抽象推理任务上取得了显著进展,但距离人类水平仍有差距。ARC-AGI-2 的失败案例提示模型在处理需要多步推理、组合泛化或新颖规则的任务时仍存在局限性。
未来展望
DeepSeek V4 Flash 0731 的成功展示了推理变体策略(不同计算预算下的性能权衡)的有效性。未来可能通过以下方向进一步提升:
- 增强对长链推理的支持,特别是当任务需要多步分解时。
- 引入更强大的元学习机制,使其能从少量示例中更快地归纳规则。
- 结合符号推理与神经网络,以处理需要精确逻辑的任务。
- 更多任务级数据,例如 ARC-AGI-3(本报告未提供具体分数),可能进一步挑战模型的极限。
总体而言,DeepSeek V4 Flash 0731 在 ARC-AGI 基准上的结果代表了 AI 抽象推理能力的重要里程碑,也为后续研究提供了有价值的参考基线。
原标题:DeepSeek V4 Flash 0731。 HN 原始发布时间:2026年8月8日星期六。当前记录为 763 分、457 条评论。