GitHub周趋势2026W25 | Headroom 压缩 95% Token、NVIDIA 开源 AI Agent 安全扫描器、…
2026-07-28
2026-07-29 0
黄仁勋在7月24日发布了个人第一条X帖子。
《开放权重与美国AI领导力》是他所转发公开信的题目。英伟达、微软、Meta、IBM等公司和机构组成了最初的25家联署方;此后名单迅速增至约50家,陆续纳入OpenAI、谷歌、AMD、思科、Cloudflare、GitHub等。在美国主要前沿模型公司范围内,尚未签署的只剩Anthropic。
“世界既需要前沿闭源模型,也需要前沿开放模型。”黄仁勋的配文仅此一句。
几天前接受外媒采访时,他的立场表达得更为直接。黄仁勋表示,中国的开源模型“非常优秀”,表现出色的开源模型理应得到使用。
一个节点先于这场集体表态出现:月之暗面于7月中旬发布Kimi K3。根据官方披露,混合专家架构被这款模型采用;其2.8万亿总参数分布在896个专家模块中,每个Token只会激活16个,同时可支持100万Token上下文。
目前公开参数规模最大的开放权重模型之列,由此有了Kimi K3的一席之地。它进入全球第一梯队的多项评测涵盖前端开发、编程和智能体,这一点更受关注。
这个来自中国、可以下载部署且性能接近顶尖闭源模型的系统,很快进入全球开发者的视野。美国AI公司的模型壁垒、开放生态的竞争力,以及华盛顿应如何看待中国模型,也随之再次成为讨论焦点。
这场博弈的一端,是科技企业对创新空间、成本和模型供给的现实需求;另一端,则是政府围绕国家安全、模型蒸馏与技术扩散产生的担忧。黄仁勋所作表态,正处于双方角力的中心。
01
开放模型迈入前沿能力区
长期以来,开放权重模型被当作闭源旗舰模型的补充:虽然价格较低、部署更加灵活,但综合能力通常存在明显差距。
这种固有印象被Kimi K3改变了。
拥有2.8万亿参数,并不等于每次推理都必须调用同等规模的计算量。混合专家架构会按照任务挑选少量专家参与计算,在增加模型知识容量的同时,将单次推理成本控制下来。
为缓解长上下文和大规模推理造成的资源压力,Kimi K3还使用了混合线性注意力、注意力残差以及低精度量化等技术。
K3的完整技术报告和模型权重于7月27日由月之暗面正式公开,上述技术如何具体实现也随之揭晓。线性注意力与完整注意力层按照3:1混合,构成KDA(Kimi Delta Attention):长序列由前者高效处理,关键位置的精度由后者维持,二者类似视频编码里差分帧和关键帧的分工。
线性注意力造成的信息损失,由Attention Residuals建立在网络层之间的直连通道予以补偿;为了让极端稀疏架构稳定收敛,Stable LatentMoE以统计方法对896个专家的训练负载进行平衡,而该架构每次仅激活16个专家。
三项训练基础设施也在报告中得到公开:支持百万Token级强化学习的智能体沙箱AgentEnv、高性能算子FlashKDA和专家通信库MoonEP。按照月之暗面的说法,同等算力下,模型智能水平可因这套架构提升约2.5倍。正因如此,尽管K3总参数达到2.8万亿,其实际推理成本仍处于企业可以接受的范围。
性能达到接近前沿闭源模型的水平、权重支持下载和修改、企业可以承受其推理成本,这三个条件开始同时被大规模开放模型满足,构成了Kimi K3真正具有行业意义之处。
企业因此拥有了新的选项。
任务若属于内容生成、编码或一般办公,闭源API仍可继续调用;任务一旦关系到合规要求、网络安全、核心代码和内部数据,开放模型则可由企业放入自己的云环境或服务器部署,使模型版本、访问权限和数据流向置于自主控制之下。
为了减少对高价闭源模型的依赖,有报道称微软正评估让Kimi K3进入部分Copilot场景及Azure。微软尚未公开确认外界流传的“每年最多节省6亿美元”,但一种趋势已被此事呈现:大型科技公司开始把开放模型用于增强供应商议价能力和控制推理成本。
能够影响企业采购决策与技术架构的前沿能力区,如今已有开放权重模型进入;它此前更多被视为低成本“平替”方案。
这构成了黄仁勋此时发声的一项重要背景。
02
硅谷围绕开源模型再次站队
Kimi K3问世后,美国针对开源模型的争论迅速加剧。
网络攻击、生物研究等高风险用途,是限制支持者担心先进模型权重广泛传播后可能流向的领域。与此同时,美国政府还关注两个问题:中国模型有无通过蒸馏取得美国模型能力,相关公司有无使用受出口管制的先进芯片。
要求政府对技术扩散、芯片使用和模型蒸馏加强监管,是OpenAI和Anthropic此前向华盛顿发出警告时提出的呼吁;两者认为,中国开源模型正对美国的AI领先地位形成威胁。
在开源支持者看来,部署方式不应与模型来源混为一谈。将模型权重下载至本地运行后,企业既能保留数据、控制访问权限,也能隔离外部连接。尤其在政府、医疗、金融和网络安全等高敏感场景中,允许模型接受修改、审计及私有部署,本身便构成安全能力。
反对全面禁止中国开源模型的意见,此前也由近200家美国初创企业致信政府表达。它们认为,一旦限制过度,创业公司的模型成本会被抬高,少数美国闭源模型供应商的垄断地位还将进一步得到强化。
硅谷因此出现了新的利益格局。
企业部署模型的需求,会随开源模型日益丰富而增强,销售GPU与整套AI基础设施的英伟达将从中受益;兼营应用产品、模型API和云计算的微软,则能借助更多模型增强议价能力并降低成本;开放生态一直被Meta用于扩大其对全球开发者的影响力;至于Cloudflare、思科和IBM等公司,关注点更多落在网络安全市场、混合云及私有部署上。
随着开源模型增加整个AI市场的参与者,基础设施供应商面对的潜在客户群也同步扩大。
Anthropic的立场明显不同。在联名公开信中,Anthropic持续缺席。他们长期将前沿模型安全作为核心战略,并警告开放先进模型权重可能降低危险的扩散门槛。
Anthropic作出这种选择,与其闭源商业模式及品牌定位保持高度一致。当开放权重模型变得更强,企业会减少对高价闭源API的依赖;随之承压的,则是Anthropic用于构建差异化竞争的模型服务和安全叙事。
表面上,这是开源与闭源之间的技术路线之争;其背后实际上是更复杂的产业利益与政策边界谈判。
03
黄仁勋真正维护的是算力市场
黄仁勋对开源模型的支持,背后存在明确的商业逻辑。
当模型供给更加丰富、使用成本继续降低,参与AI市场的个人和企业便会增加,最终生成的Token数量与算力需求也将扩大。
DeepSeek在2025年发布后,市场一度忧虑高效模型会降低GPU需求。黄仁勋多次回应称,模型效率提高将拓宽使用范围:单次推理成本下降后,开发者会更频繁地调用模型、延长运行时间,并把AI应用于更多任务。
总需求可能因为单位成本下降和一种资源的使用效率提高而增长,杰文斯悖论描述的正是这一现象。
如今,AI计算需求已经不再局限于预训练。模型还要进行监督微调、强化学习、长时间推理和智能体执行。智能体为了完成复杂任务,可能需要持续调用模型、检索资料、使用工具、核验结果,再按照反馈重新制定计划。
上述每一个环节都会消耗Token。
因此,黄仁勋把数据中心称作“AI工厂”:电力和数据是输入,Token是输出,而GPU、网络、存储、电力及数据中心共同组成一套工业化计算系统。
按照这套逻辑,无论模型公司的商业模式如何变化,算力都会继续充当共同底座。
API、企业服务和订阅为闭源模型提供收入,云部署、行业解决方案、托管与微调则支撑开源模型的商业生态。尽管路径不同,训练集群、软件工具链、高速互联和推理服务器都是两者的共同需求。
进入这个市场的中小企业还会因开源模型而增加。它们可能先试验一个开源模型,再转向更稳定的商业方案,并购买安全服务、模型托管和云算力。一旦模型投入生产环境,运维、权限、并发、延迟及可靠性将进一步带来新的基础设施需求。
黄仁勋所看重的,正是持续扩张的这一市场基数。
04
2.8万亿参数之后,竞争转向系统实力
Kimi K3把开放模型带到2.8万亿参数规模,但混合专家架构正使总参数和实际计算量逐步分离。参数数量只能体现系统容量的一部分,模型的商业价值还将由激活参数、训练数据、后训练方法、推理效率、工具使用能力以及部署成本共同决定。
下一阶段,竞争将聚焦三个层面。
第一个层面是效率。企业真正关注的是,完成一项任务要消耗多少Token、经历多少轮调用并使用多少算力。即使模型在评测中获得高分,也不意味着实际使用成本必然更低,能力、速度和成本必须一并考量。
其次,变化发生在软件生态。量化工具、智能体系统、模型融合、专业微调、芯片适配和推理框架,正由开发者围绕开放模型建设。Hugging Face托管的公开模型已经超过200万个,竞争主体也在从单一模型转变为模型家族与生态系统。
第三个层面是部署控制权。希望掌握自有模型、数据和算力基础设施的国家与企业越来越多。由于开放权重模型能够本地化、修改,并可在不同芯片上运行,它正成为主权AI及企业私有部署的重要技术基础。
开放模型的“Kubernetes时刻”,是有人对这一阶段的称呼。
云计算基础设施的重要标准,并非Kubernetes由谷歌开源之初就已形成,而是开发者、企业和云厂商共同推动的结果。开放模型或许会经历相似演进:模型权重处于基础层,其外围逐步形成行业应用、硬件适配、云服务和推理框架。
模型架构、许可证、推理框架及硬件平台尚处于高度分散状态,因此,开放生态目前能不能形成类似Kubernetes的统一标准,依旧存在很大不确定性。
随着开放模型进入前沿能力区,方向已逐渐显现:闭源公司将更多以专业场景、服务稳定性、数据闭环和产品体验构筑竞争壁垒;开放模型扩展市场所依靠的,则是生态创新、控制权与成本。
力挺“中国开源模型”并非黄仁勋表态的本意。最终无论是企业自行微调的行业模型、中国开源模型,还是美国闭源模型胜出,只要更多系统持续生成Token且AI应用继续扩张,产业增长最稳定的环节仍将由英伟达占据。
以此来看,黄仁勋发布的第一条X帖子,也可以视为写给华盛顿的一份商业意见书。他真正维护的,是模型供给更多元、开发者规模更大且算力需求持续增长的AI市场。
(转载自:腾讯科技)