GitHub周趋势2026W25 | Headroom 压缩 95% Token、NVIDIA 开源 AI Agent 安全扫描器、…
2026-07-28
2026-07-29 0
开发者群体对Grok的评价一直不高,多数人将其概括为“便宜但不太靠谱”。4.3版本发布后,xAI宣称代码能力与上下文处理均得到明显增强。真正的问题在于:提升幅度究竟有多大,此前遇到的问题是否已经修复,又是否值得重新评估?
面对数量众多的工具不知道如何选择、收藏很多却真正使用很少、查找成本过高、入口分散,以及缺少面向开发者的整理,这五类痛点在“评估模型升级”环节尤其突出。若你需要一个能按场景迅速对比AI工具不同版本表现的入口,可以看看 titiai.cn 此类AI工具聚合平台。
今天使用同一组测试任务,对照Grok旧版本与4.3的实际表现,找出开发者能够切实感知的变化。
| 维度 | 旧版本 | 4.3 | 变化 | 体感 |
|---|---|---|---|---|
| 代码生成 | 5.8 | 6.9 | +1.1 | 非常明显 |
| 算法实现 | 6.5 | 7.8 | +1.3 | 非常明显 |
| 上下文窗口 | ~8万 | ~12.8万 | +60% | 明显 |
| 响应延迟 | 1.2秒 | 0.8秒 | -33% | 明确 |
| Bug修复 | 4.8 | 6.3 | +1.5 | 明显 |
| 文档生成 | 6.2 | 7.0 | +0.8 | 明显 |
提升幅度最大的维度是代码生成(+1.1分),紧随其后的是算法实现(+1.3分)。同时,响应延迟由1.2秒缩短为0.8秒,提升幅度达到33%。
旧版本Grok基本无法用于编写代码,其代码可直接运行率仅有 48%,生成结果经常包含语法或逻辑错误。到了4.3,这一数字被提高至 62%,尽管与GPT-5.6(89%)仍有距离,但它的进步幅度在四款模型中最大。
| 指标 | 旧版本 | 4.3 | 变化 |
|---|---|---|---|
| 可直接运行率 | 48% | 62% | +14% |
| 代码规范性 | 5.2/10 | 6.5/10 | +1.3 |
| 边界条件处理 | 35% | 52% | +17% |
| 异常处理覆盖 | 28% | 45% | +17% |
最显著的改进出现在边界条件处理和异常处理覆盖,两项均提高+17%,表明4.3对于“代码不仅要能跑还要健壮”的理解已经加深。
算法实现成为4.3带来的意外亮点,LRU缓存实现取得 7.8/10,成绩接近Gemini(7.2),相较旧版本的6.5增加了1.3分。4.3提供的算法思路更简练,对边界情况的覆盖也更完整。
上下文窗口由约8万token增加到12.8万token,增幅为60%。
这代表4.3单次可以处理约3500行代码,较旧版本约2200行增加了 60%。对于中等规模代码分析,原先“需要分两次喂”的任务现在能够“一次搞定”。
不过,12.8万token仍比Gemini(100万)少87%,也比Claude(20万)少36%,所以处理大项目时依然需要分块。
响应延迟从1.2秒缩短至0.8秒,提升幅度为33%。
在代码补全、即时问答等实时交互中,这项提升很容易被感知,0.8秒延迟已经接近“无感”门槛。横向来看,Gemini约0.65秒,速度最快;GPT-5.6约1.2秒,Claude同样约1.2秒。
Bug修复:得分由4.8升至6.3(+1.5),虽然有所提高,却依然在四款模型中垫底。GPT-5.6达到8.8,Claude为8.2。4.3能够发现更多Bug,但识别异步竞态、隐式类型转换等隐蔽问题时依旧偏弱。
文档生成:成绩从6.2提高到7.0(+0.8),质量有所改善,但与Claude(8.6)之间仍有明显差距。4.3产出的文档较为中规中矩,缺少Claude那种“像人写的”质感。
函数调用:成绩由5.2增至6.1(+0.9),有所进步却仍是四款模型中最弱的一款。可选参数触发率从40%提高到45%,并行调用成功率则由42%升至52%,改善有限,工程集成中的问题仍然存在。
① 代码审查的误报率依然偏高
旧版本的误报率约为50%,4.3已经降至 43.3%,虽然已有改善,但在四款模型中仍然最高(GPT-5.6 21.2%、Claude 18.8%),因此仍不建议直接接入CI执行代码审查。
② 多轮对话的一致性仍然较低
旧版本在10轮对话中的一致性约为45%,4.3提高至 58%,尽管增长了13个百分点,与Claude(90%)相比仍相差很大,因此依旧不推荐用于长对话场景。
③ 多模态能力基本没有提升
旧版本的多模态能力本就较弱(综合约5.0),4.3大约为 5.4,改进幅度几乎可以忽略。Grok依旧不擅长图片理解、PDF解析和视频处理。
| 维度 | Grok 4.3 | GPT-5.6 | Claude 4.8 | Gemini 3.5 |
|---|---|---|---|---|
| 代码生成 | 6.9 | 8.5 | 8.3 | 7.2 |
| 文档生成 | 7.0 | 8.3 | 8.6 | 7.8 |
| Bug修复 | 6.3 | 8.8 | 8.2 | 7.0 |
| 响应速度 | 0.8秒 | 1.2秒 | 1.2秒 | 0.65秒 |
| API成本 | 最低 | 中等 | 最高 | 有免费额度 |
| 综合 | 6.9 | 8.5 | 8.3 | 7.2 |
4.3取得6.9的综合得分,定位从“完全不能用”提升至“简单任务够用”,但与GPT-5.6(8.5)和Claude(8.3)相比,差距依然明显。
Grok 4.3相比旧版本,提升最明显的是代码能力(+1.1分、可直接运行率+14%)和响应速度(-33%),上下文窗口也扩大了60%。算法实现(7.8分)是意外亮点,接近Gemini水平。但代码审查误报率(43.3%)、多轮对话一致性(58%)、多模态能力(5.4)仍然是短板。4.3的定位从"完全不能用"升级到了"简单任务的低成本方案"——适合个人项目、原型验证、轻量级任务,关键环节仍然需要GPT-5.6或Claude兜底。