AI+财务落地面临三重障碍
2026-07-25
2026-07-27 0
近日,KwaiKAT 团队正式发布旗舰级Agentic Coding模型KAT-Coder-Pro V2.5。据介绍,自KAT-Coder-Pro V2上线以来,KwaiKAT团队持续收到一线开发者的真实反馈:能不能把一个完整的issue直接交给模型,让它自己在仓库里定位、修改、跑通测试?能不能把一整段业务工作流交给它,而不只是帮忙做其中一步?围绕“更长的任务链路、更复杂的业务工作流”这一核心目标,KwaiKAT团队对模型进行了系统性升级,在长程工程能力、通用Agentic 能力和大规模Agentic强化学习体系三大维度实现全面突破。
长程工程能力:从“补代码”到“跑项目”
真实的软件工程从来不是“补一段函数”这么简单——开发者需要模型读懂模糊的自然语言需求,在几十上百个文件的仓库中定位改动位置,遵循项目既有规范给出最小改动,并通过测试验证。为此,KwaiKAT团队建设了 AutoBuilder 自动化环境构建流水线。据最新披露,这套流水线将可运行仓库环境的构建成功率从业界约16.5%大幅提升至57.2%,累计沉淀出覆盖12种编程语言、超过10万个可运行、可验证的真实“训练车间”,让模型能够在真实项目环境中完成迭代训练。
评测成绩亮眼,真实场景稳定交付
最新公布的评测结果显示,KAT-Coder-Pro V2.5在多项Coding与Agentic评测中表现稳定:
长程工程能力方面,KAT-Coder-Pro V2.5在SWE-Bench Pro上取得65.2分,在快手内部真实工程任务评测集 KAT Code Bench上取得53.1分。据最新表示,这意味着开发者可以把一个完整的issue直接交给模型,而不必先拆成一个个小改动。
通用Agentic能力方面,KAT-Coder-Pro V2.5在多轮Agentic任务评测 PinchBench上取得94.9分,在快手内部 Agentic 评测集KAT Claw Bench上取得85.5分,展现了从工具选择、上下文管理到最终交付物生成的全流程稳定表现。
目前,KAT-Coder-Pro V2.5已在StreamLake平台全量上线,开发者可通过 StreamLake.com直接调用模型 API,并将其集成到自身工作流中。
完整技术细节可在KAT-Coder-Pro V2.5技术报告中查阅:https://arxiv.org/abs/2607.05471