GitHub周趋势2026W25 | Headroom 压缩 95% Token、NVIDIA 开源 AI Agent 安全扫描器、…
2026-07-28
2026-07-29 0
过去两年间,首个真正进入专业工作流的 AI 图像模型,是 OpenAI 于 4 月 21 日推出的 GPT-Image-2,它也被称为 ChatGPT Images 2.0。
第二名落后 242 分,因为它在 LM Arena 文生图榜单取得了 1512 分。
Nano Banana Pro 到 DALL-E 所体现的代差,大致可以用来衡量这个差距。
作为新一代原生多模态图像生成模型,GPT-Image-2 由 OpenAI 于 2026 年 4 月 21 日发布,内部代号为“Spud”。
在接替 DALL-E 3 的同时,它也完成了对 GPT-Image-1.5 的全面升级。
1.生图前规划、完成后自检:原生 Thinking 模式
创建 → 打草稿 → 生成初稿 → 搭建场景 → 打磨细节 → 收尾 → 润色 → 微调,一张图必须完整经过这八步。GPT-Image-2 之所以形成这一核心架构创新,是因为接入了 OpenAI O 系列推理模型。
这一过程中还可进行联网搜索、错误自检和迭代修正。也就是说——当你要求它制作一张财报信息图时,它会先联网获取最新数据,然后绘图,并在完成后自行核对数字是否有误。
从架构层面看,所有 Diffusion 模型都无法做到这一点。
2.由世界知识驱动
生成结果之所以遵循真实产品的视觉规律,是因为 GPT-Image-2 的训练数据明显向真实视觉素材倾斜,其中包括 UI 截图、店面招牌和真实界面布局。
3. 分镜中的角色一致性
可生成一整组系列物料,例如同一 IP 形象在 8 个不同场景中的图片
4.像素级区域编辑
编辑指定区域时,其余部分基本不会发生漂移。
光照、透视与阴影的一致性能够完整保留,原本要在 PS 中“手动抠图改细节”的操作,如今一句自然语言便可完成。
| 分辨率 | Medium 质量 | High 质量 |
|---|---|---|
| 1536×1024(1.5K) | $0.04/张 | $0.16/张 |
| 2560×1440(2K) | $0.06/张 | $0.22/张 |
| 3840×2160(4K) | $0.10/张 | $0.40/张 |
从 4 月 21 日开始,所有 ChatGPT 用户,包括免费用户,都可以使用 GPT-Image-2;不过免费用户仅能使用 Instant Mode(即时模式),Thinking Mode 则位于付费墙之后。
每 24 小时采用滚动窗口计算额度,通常能生成 2~3 张;高峰期则以 3 张为封顶值。
具体操作步骤:
一个较少被提及的技巧是:任务若涉及股价、汇率或新闻热点等实时数据,可直接要求“先联网查最新数据再画图”,从而自动启动 web search + 图像生成的组合链路。
如果不清楚怎样订阅GPT,可以阅读我此前发布的文章。