BlackHalo logo
Published on

通义千问发布Qwen3.8-2.4T:2.4万亿参数混合专家模型开源,推理能力再升级

Authors
  • Name
    Philpax
    huggingface.co
Qwen3.8-2.4T-A95B混合专家模型架构示意图
头图来源: 来源页面

模型概览与核心特性

阿里云通义千问团队于2026年8月发布了其最新的开源大语言模型——Qwen3.8-2.4T-A95B。该模型在Hugging Face平台上线,迅速引起了技术社区的广泛关注。

参数规模与架构

  • Qwen3.8-2.4T-A95B的总参数量达到了惊人的2.4万亿(2.4 Trillion)。
  • 它采用了混合专家(Mixture of Experts, MoE)架构,这是一种通过将模型分解为多个专门的“专家”子网络来提高效率的设计。
  • 尽管总参数庞大,但模型在每次推理时仅激活其中的950亿(95 Billion)参数,这种稀疏激活的方式使得模型在保持强大能力的同时,计算成本远低于同等规模的稠密模型。

上下文长度与推理能力

  • 模型支持高达256K tokens的上下文长度,能够处理长篇文档、复杂对话或大型代码库。
  • 一个重要的新特性是引入了可调节的“推理努力”(Reasoning Effort)机制。用户可以通过设置reasoning_effort参数(支持xhighmediumlow三个等级)来控制模型在回答问题前的思考深度。
  • xhigh模式下,模型会进行更深入的推理、验证关键假设并考虑替代方案,从而在数学、编程和逻辑推理等复杂任务中取得更优结果。

技术细节与使用方式

聊天模板与工具调用

  • 模型使用了特定的聊天模板(Chat Template),该模板基于Jinja2语法,定义了用户、助手和系统消息的交互格式。
  • 模板中包含了详细的工具调用(Function Calling)规范。模型被训练以特定的XML格式(<tool_call>标签)来请求调用外部函数,这使其能够与外部API或数据库进行交互,扩展了其应用场景。
  • 模板强制要求工具调用必须遵循严格的格式,包括嵌套的<function>标签和参数定义,这确保了模型输出的结构化和可解析性。

推理努力机制详解

  • 推理努力机制是Qwen3.8-2.4T的一个亮点。它允许开发者在性能和深度思考之间进行权衡。
  • 当设置为low时,模型会保持思考简洁,快速得出结论,适合对延迟要求高的简单任务。
  • 当设置为xhigh时,模型会在内部进行更长的“思考”过程,这类似于让模型在给出最终答案前先进行自我反思和验证,从而提升答案的准确性和可靠性。

开源意义与社区影响

推动AI民主化

  • 阿里云通义千问团队一直致力于通过开源推动人工智能的民主化。Qwen3.8-2.4T的发布延续了这一传统。
  • 如此大规模且性能强大的模型开源,使得全球的研究人员、开发者和中小企业能够免费获取并使用顶尖的AI技术,无需承担高昂的研发成本。

对AI生态的贡献

  • 该模型的发布为开源大模型社区注入了新的活力。它提供了一个强大的基座模型,开发者可以基于它进行微调、部署和二次开发,应用于各种垂直领域。
  • 模型在Hugging Face上的高关注度(在Hacker News上获得了超过700分)也反映了社区对其技术价值的认可。

总结与展望

Qwen3.8-2.4T-A95B的发布标志着开源大语言模型在规模和效率上又迈出了重要一步。通过混合专家架构和创新的推理努力机制,它在保持高性能的同时,提供了灵活的部署选项。这不仅展示了阿里云在AI基础研究上的深厚积累,也为全球AI应用的普及和发展提供了强大的基础设施。未来,我们可以期待看到基于此模型构建的更多创新应用和服务。

原标题:Qwen3.8-2.4T。 HN 原始发布时间:2026年8月12日星期三。当前记录为 700 分、168 条评论。

阅读原文 · 查看 HN 讨论