Published on2026年8月18日Qwen 3.8 27B:本地大模型的性能与过度思考问题大语言模型本地部署推理加速开源阿里巴巴Qwen团队发布Qwen 3.8 27B模型,这是一个27B参数、支持视觉的Apache 2开源大模型。作者Simon Willison测试发现,该模型默认采用极高推理深度,导致对简单问题也过度思考,生成速度极慢。但关闭或降低推理深度后,模型在边界框标注、代码生成等任务上表现出色,且能在消费级硬件上运行。性能是其主要瓶颈,但社区已探索出多令牌预测等加速方案。
Published on2026年7月30日TurboFieldfare:在2GB内存的M系列Mac上运行Gemma 4 26B大模型大语言模型开源本地部署推理加速TurboFieldfare 是一个开源推理引擎,专为 Apple Silicon Mac 设计,能在仅约 2GB 内存中运行 260 亿参数的 Gemma 4 26B-A4B 模型。它通过 SSD 流式传输专家权重,避免加载完整 14.3GB 模型,使 8GB 内存的 MacBook Air 也能流畅运行,解码速度可达 5-6 tok/s。
Published on2026年7月1日Qwen 3.6 27B:本地开发最佳选择大语言模型开源推理加速本地部署Qwen 3.6 27B 模型在本地开发中表现出色,性能接近前沿模型,且能在 Macbook 或 Nvidia RTX 上运行。通过 llama.cpp 部署,速度可达 30+ tokens/s,支持代码生成、创意写作等任务。文章详细介绍了安装、量化选择和性能测试,并讨论了本地模型的前景。