GitHub周趋势2026W25 | Headroom 压缩 95% Token、NVIDIA 开源 AI Agent 安全扫描器、…
2026-07-28
2026-07-28 0
阿里巴巴在一个月内分两次开源了Qwen3.5全系列模型。第一次是2026年2月16日除夕,发布了397B参数的旗舰版及中等规模模型;第二次是3月3日,补全了0.8B到9B的四款端侧模型。这两批模型共享同一套MoE架构基因,但面向的部署场景截然不同。

Qwen3.5-Plus采用3970亿总参数、170亿激活参数的MoE架构。模型内部部署128个"专家"网络,通过Top-4路由机制,每个token只触发最相关的4个专家参与运算。这种设计让训练成本降低90%,显存占用减少60%,但保持了万亿级模型的知识容量。
更关键的架构创新是注意力机制的混装部署。传统Transformer的softmax注意力复杂度为O(n²),是长文本处理的瓶颈。Qwen3.5在60层网络中引入Gated DeltaNet(GDN)门控线性注意力,将部分层的复杂度降至O(n),关键层保留softmax注意力维持精度。在32K上下文长度下,解码吞吐量较Qwen3-Max提升8.6倍;在256K长度下提升19倍。
为支撑原生多模态训练,Qwen团队在基础设施层进行了全栈重构。首先是异构并行策略——视觉与语言组件采用解耦的并行计算,在混合文本、图像、视频数据时实现计算重叠,使多模态训练吞吐量接近纯文本基线。
后训练阶段采用可扩展的异步强化学习框架:训推分离架构支持百万级Agent环境交互;引入投机采样(Speculative Sampling)、Rollout路由回放等技术,将端到端训练速度提升3-5倍。官方数据显示,随着RL环境规模的扩展,模型在通用Agent能力上获得显著增益,这种"授人以渔"的训练策略使其在Tool-Decathlon、MCP-Mark等工具调用基准上表现突出。
与后期拼接视觉模块的方案不同,Qwen3.5采用Early Fusion策略,在预训练阶段就将文本、图像、视频token统一处理。视觉端采用SigLIP-2编码器配合窗口注意力机制,降低计算开销;通过DeepStack机制,视觉特征直接注入语言模型的多个中间层,而非仅在输入层处理。
词表扩展至25万token(前代15万),覆盖201种语言及方言(前代119种),小语种编码效率提升10-60%。这种设计使得模型在处理古籍、小语种文档时,token化后的序列长度更短,推理成本更低。
除夕发布的批次面向云端和私有化部署:
397B-A17B(Plus):旗舰版,256K上下文,适合高并发API服务122B-A10B:性价比之选,32K-256K上下文窗口35B-A3B:仅激活30亿参数,显存需求与9B模型相当,但性能接近GPT-4o-mini3月3日发布的轻量级模型面向端侧:
9B:Dense架构,16GB显存可运行,适合中小企业私有化部署4B/2B/0.8B:INT4量化后可在1-2GB显存运行,适用于手机、IoT设备及边缘计算场景Qwen3.5在Agent基准测试中表现突出:GPQA Diamond(研究生级别推理)得分88.7,IFBench(指令遵循准确率)得分76.5并超越所有对比模型。这得益于其原生多模态能力——模型可直接识别手机或电脑屏幕上的UI元素,执行点击、滑动、输入等操作,无需将图像转换为文本的中间步骤。
官方技术报告强调,相比Qwen3系列,Qwen3.5的后训练性能提升主要归功于强化学习环境和任务的全面扩展。团队不再局限于针对特定指标优化,而是强调RL环境的难度与可泛化性,使模型在多步骤任务规划和工具调用上具备更强的鲁棒性。
分阶段开源策略反映了阿里对技术生态的布局:先用除夕的旗舰模型证明稀疏架构可以击败万亿参数稠密模型,再用3月的小模型占领端侧。对于开发者而言,这意味着可以从0.8B到397B之间无缝切换,同一套代码库既能跑在手机端,也能部署在A100集群。
当35B-A3B模型以8.6%的激活参数超越235B稠密模型的性能,行业竞争焦点已从"参数规模"转向"架构效率"。在算力成本敏感的当下,这种稀疏激活、混合注意力、原生多模态的技术路线,正在重新定义大模型从实验室到生产环境的迁移标准。
本文参与腾讯云自媒体同步曝光计划,分享自微信公众号。原始发表:2026-03-06,如有侵权请联系[email protected] 删除