跳到正文

OpenAI 推出 ChatGPT Images 2.0,图像生成开始接入推理与联网信息

OpenAI 发布新的图像生成模型 ChatGPT Images 2.0。该模型可在单次提示中生成多张图片、处理英文之外的文本排版,并调用 ChatGPT 的推理与联网能力,让图像生成结果更细致也更具上下文。

功思 AI 编辑部

约 1 分钟读完

OpenAI 推出 ChatGPT Images 2.0,图像生成开始接入推理与联网信息

OpenAI 周二推出新的图像生成模型 ChatGPT Images 2.0。按照报道,这个模型不仅能从一次提示中生成多张图片,例如整套学习手册,还能输出包含中文、印地语等非英语文本的图像内容。

对大型 AI 公司来说,每次发布新的图像模型,往往都能重新点燃用户兴趣并带动使用量,尤其是在社交媒体出现可快速传播的模板玩法时更是如此。

这次更新的一个关键点在于,Images 2.0 能调用 ChatGPT 的“推理”能力,并通过联网搜索获取最新信息。这样一来,模型可以在单次提示下执行更多中间步骤,输出更完整、更细致的图像结果。

作者举例称,自己让模型生成一张包含旧金山次日天气预报和活动建议的信息图,结果不仅给出了与雨天相符的天气细节,还结合当地情况生成了较准确的活动推荐。

Images 2.0 还支持更灵活的长宽比设置,生成范围可从 3:1 的超宽图到 1:3 的竖长图,用户可以直接在提示词中指定图像尺寸。

在英文文本渲染方面,作者对新模型的表现总体印象较好。相比此前主流模型在图中插字时常见的乱码、错字或畸形单词,这次更新明显更成熟。

不过在非英语场景下,表现仍不稳定。作者测试生成一张带有 Timothée Chalamet 主题、模仿中文粉丝海报风格的拼贴海报时,ChatGPT 自己也承认图中不少文字是“伪中文”或半通不通的 AI 文本,其中夹杂了明显错误甚至日文字符。

因此,这一模型在英文文本生成方面已经迈出明显一步,但全球用户在本地语言中的体验是否同样稳定,仍有待更多验证。报道认为,考虑到 OpenAI 在英文图像文本渲染上的进展,其它语言表现后续仍可能继续提升。

参与讨论

正在确认登录状态…