摘要 四个 Logo、一次融合、一次局部修改,再验一次真透明。 黑粉科技 · 2026-09-09

OpenAI 在 9月8日发布 ChatGPT Images 2.5 时,给出的数字很大:ChatGPT Images 与 GPT-Image API 每周已经生成约 30 亿张图,新版相对 Images 2.0 最高降低 50% 延迟。
可对真正天天做封面的人来说,最痛的从来不是少等十几秒,而是:第一张挺惊艳,第二句让它改个小地方,整张脸、Logo 和构图一起变了。
所以我没拿风景和美女图做演示。我把黑粉剪辑 HyphenCut、黑粉盒子 HyphenBox、LocalBrain、ScreenLex 四枚现有产品图标交给它,连续做三道题:一次生成统一 3D 场景;只换中央一个物体;再做一套真正透明的贴纸。
结论先说:它已经很接近“能听懂修改意见的视觉导演”,但仍然不是 Photoshop 图层,也不能替你对品牌和真人身份负责。
🎯 ▍OpenAI 为什么现在补工作流,而不只补画质
OpenAI 为什么现在做这次升级?因为它真正想抢的是创作入口。单张图片再惊艳,用户做完就走;一旦草图、模板、评论、多轮修改和描述分享都留在同一个界面,创作者从想法到交付就不必离开。API 再按 token 计费,个人流量和开发者工作流会同时变成长期收入。
受益的是需要高频出图的创作者和把生图嵌进产品的开发者;被压到下面的,则是大量机械抠图、简单换景和首轮视觉探索。真正买单的可能仍是团队:生成成本下降之后,审核 Logo、文字、肖像权和品牌一致性的责任并不会消失。
🔍 ▍官方演示最强的地方,是把“重画”变成“修改”
官方重点展示的不是从零生一张漂亮图,而是保留原图主体,只改用户明确指出的部分:换衣服、改背景、调整布局、继续多轮编辑。新增的 Sketch 可以让人直接在图上圈画,图片评论能把反馈挂在具体位置,模板和生成描述分享则把一次灵感变成可复用工作流。

这条路线很关键。早在第一代文本生图工具流行时,创作就像“一次抽卡”:先得到八十分,再说一句修改,整张图重新洗牌。如果主体和构图能稳住,三四轮反馈才可能把它推到九十分,生图也才真正进入生产环节。
⚡ ▍第一关:四个 Logo 能不能一次融进同一画面
我的要求故意比“把四张 PNG 排成一排”更难:四个图标必须变成统一材质、统一灯光、统一透视的立体主体,像原本就属于同一间未来工作室。这里最容易翻车的是 LocalBrain——它的图标就是明确的 LB 字母,不能凭空换成另一家产品的标志。

结果比预期完整:四个主体都出现了,LB 结构可以认出,材质、投影和环境光也统一。它没有那种“Logo 像贴纸浮在背景上”的割裂感,作为封面初始视觉已经很能打。工具链端到端约 42.8 秒。
警告 这里仍然要踩刹车:生成模型会对线条、倒角和局部比例做自己的解释。看起来像,不代表符合品牌规范;正式发布前必须与原始图标逐个核对。
💰 ▍第二关:只改一个物体,它会不会偷偷重画全图
第二轮我要求只把中央的线框立方体换成红色闪电按钮,四个图标、相机、桌面、构图和灯光都不要动。肉眼看,任务完成得非常干净:主角换了,四周仍然是同一组角色。

但我又做了一次像素比较。上一次大家把“局部编辑”理解成 Photoshop 蒙版时,容易忽略生成模型仍会重新采样整张画面。
排除中央编辑区域后,两张图的平均绝对通道差仍有 3.86/255,完全相同的像素只有 1.79%,PSNR 是 29.73dB。它保住的是主体身份、空间关系和视觉印象,不是把其他区域逐像素锁死。
这恰好说明它适合什么:改封面概念、换道具、调气氛,很好用;修改精确 UI 截图、医学图、合同印章或必须一像素不动的产品图,就不该只靠一句“其他不变”。第二轮端到端约 29.3 秒,也明显快于另外两轮,但这只是本次整条工具链耗时,不是可与官方基准直接比较的纯模型延迟。
🧩 ▍第三关:透明背景到底是真透明,还是画了棋盘格
透明 PNG 是另一个常见笑话:嘴上说透明,交付一看只是白底,甚至把灰白棋盘格画进了图片。我让它把四个图标做成独立 3D 贴纸,并要求真实 alpha 通道。

文件检查显示,这是一张 1254×1254 的 RGBA PNG:完全透明像素占 33.86%,alpha 不低于 240 的高不透明像素占 61.51%,不是视觉障眼法。
端到端耗时约 42.1 秒。对做公众号插图、封面小物件和视频动效的人,这类可直接抠走的素材,比“再漂亮一张成图”更实用。
| 测试 | 结果 | 不能误读成 |
|---|---|---|
| 四图标一次融合 | 四个主体与统一 3D 光影都出现 | 品牌几何百分百不变 |
| 只换中央物体 | 主体关系保持,区域外平均差 3.86/255 | 其余像素完全冻结 |
| 透明贴纸 | RGBA,33.86% 像素完全透明 | 所有边缘都无需验收 |
三项均为本次实际生成与文件检查;耗时是整条工具链的端到端时间。
🚀 ▍Flare 和 Sunburst,差别不是简单的高低配
API 侧现在分成 Flare 与 Sunburst。Flare 是默认选择,目标是大多数任务下更快、更便宜;Sunburst 面向更精确、允许更长生成时间的任务。创作者不必每张都上最慢那档:批量找构图用 Flare,最终关键视觉再交给 Sunburst,更符合真实工作流。
价格也需要纠正一个容易传播的误会。9月9日查看 OpenAI 官方价格页,2.5 Flare、2.5 Sunburst 与 GPT-Image-2 的标准图像 token 价格列在同一档:图像输入 8 美元/百万、缓存输入 2 美元/百万、输出 30 美元/百万;文本输入 5 美元/百万、缓存 1.25 美元/百万。把旧批处理价和新标准价混在一起,会得出“翻倍”的假结论。
🧠 ▍对我的封面流程,真正改变的是第一步
以前做封面,背景、主体、Logo 往往各自生成,再一层层拼。历史上从摄影暗房到数字图层,生产工具一直在把不可逆操作变成可修改流程;现在生成模型也走到这一站。先让它一次生成非人物主体、品牌符号、实物和环境光,画面从出生时就是一个整体。它减少的是“后贴感”,不是取消后期。
真人部分仍然坚持另一条线:本人的真实照片不交给模型重画,先生成不含真人的完整场景,再用确定性抠图与合成把本人放进去,最后分别验 1:1 消息封面和 2.35:1 正文横图。这样既能得到整体冲击力,也不会把脸变成“很像我的陌生人”。
摘要:三轮之后,我的判断 一次成图能让四个品牌主体进入统一光影和空间;局部编辑能保持语义与构图,但不是像素级冻结;透明素材确有 RGBA 与真实透明区域;精确 Logo、长文字、真实人物身份和跨比例裁切仍要人工验收。
建议 一手来源 ChatGPT Images 2.5 官方介绍:https://openai.com/index/introducing-chatgpt-images-2-5/ OpenAI API 官方价格:https://openai.com/api/pricing/
本文三轮测试图、透明通道统计与改图差异均为黑粉科技本次实测;生成时间是端到端工具链耗时,不代表官方模型基准。
建议 我目前的4款自制软件 · 黑粉剪辑 HyphenCut(正式迭代)——对话式视频剪辑器,自带 MCP 可被 agent 驱动 https://github.com/HackerChi-Hub/HyphenCut-Releases/releases · 黑粉盒子 HyphenBox(初步构建 · 预览版)——免费大模型 API 雷达 + 本地统一路由:持续复测可用性、Key 只存本机、auto 自动挑模型 https://github.com/HackerChi-Hub/hyphenbox-release/releases · LocalBrain(正式迭代)——把 Mac 变成私有 AI 盒子:转写/配音/生图/视频/MCP 一站管理 https://github.com/HackerChi-Hub/localbrain-releases/releases · ScreenLex 光影词库(正式迭代)——看美剧顺手把生词背了,Mac/Windows 双平台,免费 https://github.com/HackerChi-Hub/screenlex-download/releases
黑粉科技 · 本地部署 / 免费白嫖 / 自制软件 宣传语:让AI成为你的超能力 https://hyphentech.top
引用:黑粉科技 让AI成为你的超能力 本地部署 / 免费白嫖 / 自制软件 https://hyphentech.top
