跳到正文

ChatGPT Images 2.0 是一项突破,可能从根本上重塑图像生成

OpenAI 为 ChatGPT Images 2.0 加入推理与联网搜索,支持单条提示生成最多 8 张一致图像,并提升文字尤其非拉丁文字表现,同时公布了 gpt-image-2 的 API 定价与应用场景。

功思 AI 编辑部

约 4 分钟读完

ChatGPT Images 2.0 是一项突破,可能从根本上重塑图像生成

OpenAI 正在为其 ChatGPT Images 2.0 图像生成器加入推理和联网搜索能力。该模型现在可以根据一条提示生成最多八张保持一致性的图像,并且对文本的处理能力整体提升明显,尤其是在非拉丁文字方面。

OpenAI 的新图像模型已正式发布。ChatGPT Images 2.0 基于新的 GPT Image 2 模型,与谷歌的 Nano Banana Pro 具备相同的核心能力:模型会在生成前先“思考”,并根据所选模式投入不同长短的推理时间,甚至还能在这一过程中搜索网络。

按照 OpenAI 博客文章的说法,这应当会提升生成图像的多样性和准确性。不过,带有思考过程的扩展输出目前仅向 ChatGPT Plus、Pro 和 Business 用户开放。

在开启 thinking 模式后,ChatGPT Images 2.0 可以根据单条提示一次生成最多八张图像。角色、物体和风格应当能在所有场景中保持一致。OpenAI 给出的示例用途包括:根据一张图片和一段文本提示生成整页漫画、生成一系列社交媒体图形,以及为房屋中不同房间生成设计方案。

所有用户都能获得更好的图像质量

无论是否启用 thinking 模式,所有 ChatGPT 用户的图像质量都会得到提升。OpenAI 表示,生成器现在能更好地捕捉“照片的特征”,并在像素艺术、漫画、电影剧照等图像类型上有所改进。该模型还被设计为更好处理以往图像模型持续吃力的细节元素,包括小字、图标、UI 元素、密集构图和细微的风格指令。

支持的纵横比范围从 3:1(超宽)到 1:3(超高),覆盖横幅、演示文稿幻灯片到手机屏幕等格式。通过 API,分辨率最高可达 2K。

API 定价按 token 计费,并与质量挂钩

开发者可以通过 API 将该模型接入自己的产品,API 名称为 gpt-image-2。OpenAI 按 token 计费:图像输入 token 每百万个收费 $8,图像输出 token 每百万个收费 $30。文本 token 每百万个的输入价格为 $5,输出价格为 $10。缓存输入更便宜。

实际上,单张图像的成本会因质量和分辨率而有很大差异。根据 OpenAI 的价格概览,1024 x 1024 图像在低质量下仅需 $0.006,中等质量为 $0.053,高质量为 $0.211。分辨率更高的 1024 x 1536 反而略便宜一些,对应分别为 $0.005、$0.041 和 $0.165。

在更高分辨率下,GPT Image 2 比前代更便宜:1024 x 1536 的高质量输出价格为 $0.165,相比之下,GPT Image 1.5 为 $0.20,GPT Image 1.5 为 $0.25。不过,在标准 1024 x 1024 分辨率的高质量设置下,新模型实际上更贵,为 $0.211,而 GPT Image 1.5 为 $0.133。高于 2K 的 API 输出仍处于 beta 阶段,结果可能不稳定。

OpenAI 将本地化广告、信息图、教育内容、设计工具和创意平台列为重点应用场景。在 Codex 中,图像生成功能将可直接在工作区内使用,无需单独的 API key。

在我们的基准提示测试中,ChatGPT Image 2 的表现很不错。无论是 instant 模式还是 thinking 模式,都能以较强的细节把控能力处理这条复杂且抽象的提示。

一张极度逼真的 DSLR 照片。前景中,一只拿着粉色香蕉的猴子正坐在一只老虎身上。背景中,一匹 HORSE 正在骑着一名 ASTRONAUT。宇航员在下方,像一个活的“宇航服马鞍”,而 HORSE 明确在上方、掌控局面,并作为骑手。必须做到 100% 不含歧义:HORSE 是骑手,ASTRONAUT 是被骑的一方,绝对不是反过来。高分辨率,清晰对焦,真实光照。

instant 模式的输出看起来略带人工痕迹,而 thinking 版本则更好地做出了 DSLR 质感。

OpenAI 新的 ChatGPT 图像模型即将到来。其代号为“gpt-image-2”,目前已经提供给部分 ChatGPT 测试者,并开始出现在排行榜上。最近,一些生成结果已在 X 和 Reddit 上流出,其中很多几乎与真实照片难以区分。到目前为止,访问权限似乎仅限于美国的测试者或使用美国账号的用户。

据称,该模型在处理带文本的复杂图像和图表方面强得多,包括细节丰富的截图;这很适合广告和教育类场景,例如信息图,因为这些场景很看重稳定可靠的文字渲染。

据称,该模型还修正了那种明显的“AI 味”:过于光滑的皮肤和过于完美的光线,这些问题在 GPT-image 1.5 中依然存在,而当时谷歌的 Nano Banana Pro 明显更占优势。OpenAI 将在今晚的直播中正式发布该模型,直播于太平洋时间中午 12 pm PT 开始。

别错过重要内容

持续了解 AI 动向。清晰、有用、不空泛。

AI 社区与洞察

关注 The Decoder,获取 AI 新闻、背景报道和专家分析。

THE DECODER 新闻简报

持续了解 AI 动向。清晰、有用、不空泛。

参与讨论

正在确认登录状态…