- Published on
通义千问发布Qwen3.8-2.4T:2.4万亿参数混合专家模型开源,推理能力再升级
- Authors
- Name
- Philpax
- huggingface.co

模型概览与核心特性
阿里云通义千问团队于2026年8月发布了其最新的开源大语言模型——Qwen3.8-2.4T-A95B。该模型在Hugging Face平台上线,迅速引起了技术社区的广泛关注。
参数规模与架构
- Qwen3.8-2.4T-A95B的总参数量达到了惊人的2.4万亿(2.4 Trillion)。
- 它采用了混合专家(Mixture of Experts, MoE)架构,这是一种通过将模型分解为多个专门的“专家”子网络来提高效率的设计。
- 尽管总参数庞大,但模型在每次推理时仅激活其中的950亿(95 Billion)参数,这种稀疏激活的方式使得模型在保持强大能力的同时,计算成本远低于同等规模的稠密模型。
上下文长度与推理能力
- 模型支持高达256K tokens的上下文长度,能够处理长篇文档、复杂对话或大型代码库。
- 一个重要的新特性是引入了可调节的“推理努力”(Reasoning Effort)机制。用户可以通过设置
reasoning_effort参数(支持xhigh、medium、low三个等级)来控制模型在回答问题前的思考深度。 - 在
xhigh模式下,模型会进行更深入的推理、验证关键假设并考虑替代方案,从而在数学、编程和逻辑推理等复杂任务中取得更优结果。
技术细节与使用方式
聊天模板与工具调用
- 模型使用了特定的聊天模板(Chat Template),该模板基于Jinja2语法,定义了用户、助手和系统消息的交互格式。
- 模板中包含了详细的工具调用(Function Calling)规范。模型被训练以特定的XML格式(
<tool_call>标签)来请求调用外部函数,这使其能够与外部API或数据库进行交互,扩展了其应用场景。 - 模板强制要求工具调用必须遵循严格的格式,包括嵌套的
<function>标签和参数定义,这确保了模型输出的结构化和可解析性。
推理努力机制详解
- 推理努力机制是Qwen3.8-2.4T的一个亮点。它允许开发者在性能和深度思考之间进行权衡。
- 当设置为
low时,模型会保持思考简洁,快速得出结论,适合对延迟要求高的简单任务。 - 当设置为
xhigh时,模型会在内部进行更长的“思考”过程,这类似于让模型在给出最终答案前先进行自我反思和验证,从而提升答案的准确性和可靠性。
开源意义与社区影响
推动AI民主化
- 阿里云通义千问团队一直致力于通过开源推动人工智能的民主化。Qwen3.8-2.4T的发布延续了这一传统。
- 如此大规模且性能强大的模型开源,使得全球的研究人员、开发者和中小企业能够免费获取并使用顶尖的AI技术,无需承担高昂的研发成本。
对AI生态的贡献
- 该模型的发布为开源大模型社区注入了新的活力。它提供了一个强大的基座模型,开发者可以基于它进行微调、部署和二次开发,应用于各种垂直领域。
- 模型在Hugging Face上的高关注度(在Hacker News上获得了超过700分)也反映了社区对其技术价值的认可。
总结与展望
Qwen3.8-2.4T-A95B的发布标志着开源大语言模型在规模和效率上又迈出了重要一步。通过混合专家架构和创新的推理努力机制,它在保持高性能的同时,提供了灵活的部署选项。这不仅展示了阿里云在AI基础研究上的深厚积累,也为全球AI应用的普及和发展提供了强大的基础设施。未来,我们可以期待看到基于此模型构建的更多创新应用和服务。
原标题:Qwen3.8-2.4T。 HN 原始发布时间:2026年8月12日星期三。当前记录为 700 分、168 条评论。