Published on2026年9月11日DeepSeek 发布 V4.1 Flash:更强推理、极致压缩、半价优惠大语言模型开源人工智能推理加速DeepSeek 正式推出 V4.1 Flash,这是其新架构家族中最小的模型,原生支持多模态视觉理解。该模型拥有 552B 参数(MoE),采用非对称编码器-解码器结构,输入仅需 8B 活跃参数,输出 16B。KV 缓存大幅压缩至原版 1/4,显著节省显存和存储。API 已上线,引入峰谷定价,低谷时段价格减半,旨在降低用户成本。开源计划同时推进。
Published on2026年8月18日Qwen 3.8 27B:本地大模型的性能与过度思考问题大语言模型本地部署推理加速开源阿里巴巴Qwen团队发布Qwen 3.8 27B模型,这是一个27B参数、支持视觉的Apache 2开源大模型。作者Simon Willison测试发现,该模型默认采用极高推理深度,导致对简单问题也过度思考,生成速度极慢。但关闭或降低推理深度后,模型在边界框标注、代码生成等任务上表现出色,且能在消费级硬件上运行。性能是其主要瓶颈,但社区已探索出多令牌预测等加速方案。
Published on2026年8月15日Qwen 3.8 27B 模型发布:FP8 量化与全新聊天模板大语言模型开源推理加速科技阿里云通义千问团队发布了 Qwen 3.8 27B 模型,采用 FP8 量化技术,在保持 27B 参数规模的同时大幅降低显存占用。该模型引入了全新的聊天模板,支持图像和视频输入,并提供了可调节的推理努力程度选项,为开发者提供了更灵活、高效的部署方案。
Published on2026年8月14日通义千问发布Qwen3.8-2.4T:2.4万亿参数混合专家模型开源,推理能力再升级大语言模型开源机器学习推理加速阿里云通义千问团队在Hugging Face上发布了Qwen3.8-2.4T-A95B模型。该模型拥有2.4万亿总参数,采用混合专家架构,每次推理仅激活950亿参数,兼顾性能与效率。模型支持高达256K的上下文长度,并引入了可调节的推理努力机制,在数学、编程等复杂任务上表现优异。此次开源延续了Qwen系列推动大模型民主化的理念。
Published on2026年8月13日DeepSeek V4 Pro 0813 正式发布:高性能混合专家模型,定价与基准详解大语言模型人工智能基准测试推理加速DeepSeek 推出 V4 Pro 0813 大型混合专家模型(MoE),GA 版本提供 1M 上下文窗口、384K 最大输出,定价 $0.435/M 输入、$0.87/M 输出。OpenRouter 已上线,附独立基准测试及性能指标。
Published on2026年8月9日DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试中取得 89% 高分人工智能基准测试大语言模型推理加速DeepSeek V4 Flash 0731 在 ARC-AGI-1 半私有测试集上以每任务 0.02 美元的成本获得 89% 的准确率,在更难 ARC-AGI-2 上以 0.04 美元获得 61.4%。该模型通过三种推理变体(Max/High/Low)在不同难度上展示了显著的性能差异,并在成本效率上表现出色。
Published on2026年8月8日AMD收购AI芯片初创公司Taalas:将模型权重蚀刻进硅片,推理速度飙升人工智能芯片并购推理加速AMD宣布收购AI芯片初创公司Taalas,其技术将模型权重直接蚀刻到硅片中,实现模型专用集成电路(MSIC)。早期测试显示,该芯片处理Llama 3.1 8B模型时每秒可生成近17000个token,性能远超传统GPU。该技术虽速度极快,但模型固定后难以更改,适合对模型稳定性要求高的推理场景。
Published on2026年7月30日TurboFieldfare:在2GB内存的M系列Mac上运行Gemma 4 26B大模型大语言模型开源本地部署推理加速TurboFieldfare 是一个开源推理引擎,专为 Apple Silicon Mac 设计,能在仅约 2GB 内存中运行 260 亿参数的 Gemma 4 26B-A4B 模型。它通过 SSD 流式传输专家权重,避免加载完整 14.3GB 模型,使 8GB 内存的 MacBook Air 也能流畅运行,解码速度可达 5-6 tok/s。
Published on2026年7月17日Kimi K3:开源前沿智能模型发布大语言模型开源推理加速注意力Kimi 发布全球首个开源 3T 级模型 Kimi K3,拥有 2.8 万亿参数、原生多模态和百万 token 上下文。在编码、知识工作和推理方面达到前沿水平,并开源完整权重。文章详述其架构创新(KDA、AttnRes、Stable LatentMoE)及在 GPU 编译器、游戏开发、芯片设计等领域的突破性应用。
Published on2026年7月1日Qwen 3.6 27B:本地开发最佳选择大语言模型开源推理加速本地部署Qwen 3.6 27B 模型在本地开发中表现出色,性能接近前沿模型,且能在 Macbook 或 Nvidia RTX 上运行。通过 llama.cpp 部署,速度可达 30+ tokens/s,支持代码生成、创意写作等任务。文章详细介绍了安装、量化选择和性能测试,并讨论了本地模型的前景。