跳到正文

新基准发现:即使最强 AI 模型,图表一复杂性能也会损失约一半

RealChart2Code 基准测试了 14 个主流 AI 模型在复杂真实数据可视化上的表现。结果显示,即使领先的闭源模型,相比简单基准也会损失近一半性能,开源模型下滑更明显。

功思 AI 编辑部

约 4 分钟读完

新基准发现:即使最强 AI 模型,图表一复杂性能也会损失约一半

RealChart2Code 基准测试将 14 个领先 AI 模型置于基于真实世界数据集构建的复杂可视化任务中进行评估。结果显示,即使是表现最好的闭源模型,与更简单的测试相比,性能也会损失近一半。

AI 模型从图像重建简单图表通常问题不大。但当任务变成基于真实数据的复杂、多部分可视化时,即使能力最强的模型也会遇到明显瓶颈。这是 RealChart2Code 得出的结论。该基准由来自中国多所高校的研究团队提出。

该基准包含 2800 多个基于真实 Kaggle 数据集构建的测试样例。此前的 Plot2Code 和 ChartMimic 等基准大多依赖合成数据和简单单图表。RealChart2Code 更进一步,向模型提供复杂的组合式布局、50 种不同图表类型以及大型原始文件。研究人员从 1036 个经过筛选的数据集中取样,这些数据总计约有 8.6 亿行。

三项任务,对应三种不同能力

RealChart2Code 从三项任务测试模型。在“Chart Replication”中,模型只能根据图像生成可视化代码;“Chart Reproduction”则加入原始数据,用于检验模型能否从真实数据源生成正确代码;第三项任务“Chart Refinement”模拟实际开发流程:模型会拿到一段有问题的代码,并需要通过与用户来回对话进行修复。

论文称,RealChart2Code 是首个系统性评估基于大型原始数据集生成代码,以及在对话形式下进行迭代式改进的基准。

闭源模型领先,但仍明显不够

研究团队共测试了 14 个模型,其中 5 个为闭源模型,9 个为开放权重模型。在闭源模型中,Anthropic 的 Claude 4.5 Opus 以 8.2 的平均分排名第一,这一评分覆盖 8 项视觉准确性标准。Google 的 Gemini 3 Pro Preview 紧随其后,平均分为 8.1,并在基础图表复现任务上以 9.0 位居第一。OpenAI 的 GPT-5.1 明显落后,仅为 5.4。

开放权重模型表现差得多。表现最好的 Qwen3-VL-235B 和 Intern-VL-3.5-241B 分别只有 3.6 和 3.4,不到领先闭源模型成绩的一半。测试中体量较小的模型之一 DeepSeek-VL-7B,在图表复现任务中的通过率仅为 9.7%,这意味着其生成的代码在超过 90% 的情况下甚至无法运行。

论文的核心发现是研究人员所说的“复杂度鸿沟”:在更简单基准上表现出色的模型,到了 RealChart2Code 上会明显失效。以 Gemini 3 Pro Preview 为例,它在 ChartMimic 上的归一化得分超过 96%,但在 RealChart2Code 上降至约 50%。开放权重模型的下滑更陡。Qwen3-VL-235B 在 ChartMimic 上约为 85%,在新基准上则低于 25%。

开放权重模型会虚构库,闭源模型会混淆数据

错误分析显示出两种很不相同的失败模式。Qwen3-VL 和 InternVL 这类开放权重模型,常常在代码执行阶段出问题。它们会虚构并不存在的库,或调用无效函数。

例如,Qwen3-VL-235B 在大约 20% 的情况下会生成无效的 API 调用,比如并不存在的 Matplotlib 样式参数。而即便代码能够运行,也经常出现布局问题,例如子图重叠或网格结构损坏。

Claude 4.5 和 GPT-5.1 这类闭源模型很少产生语法错误。它们的薄弱环节在于数据分配:可视化结构看起来是对的,但具体的数据序列会落在错误的坐标轴上,或视觉属性与要求不符。

迭代式改进也是一个难点。研究人员描述了一种他们称为“回归式编辑”的模式:当模型被要求修复一个错误时,往往会在过程中破坏此前已经正确的代码部分。论文指出,即使是表现最好的模型,也很难在局部修改与整体代码一致性之间取得平衡。

自动化评估与人工判断基本一致

在评分方面,研究团队使用了一个多智能体系统,从 8 项标准出发,以三级评分尺度对生成的可视化结果进行评估,这些标准包括图表类型、空间布局、文本元素、坐标轴配置和配色方案。

自动化评估与人工专家判断的一致性较高,Cohen's Kappa 达到 0.83。智能体之间的一致性则达到 Fleiss' Kappa 0.82。

研究人员也承认,这一基准目前仅限于将 Matplotlib 作为可视化库,而且自动评分可能会遗漏一些细微的视觉瑕疵,例如轻微的元素重叠或精确的颜色差异。该基准及其代码已发布在 GitHub 和 Hugging Face 上。

Google 此前的 PaperBanana 研究项目也显示,复杂可视化对 AI 图像生成器来说难度很高。5 个专门化 AI 智能体协作,根据文本描述生成科学图表。其可视化保真度为 45.8%,低于人工参考结果,但在人类评审中,接近 73% 的情况下,这些结果仍优于普通图像生成。对于统计图,PaperBanana 也会回退到使用 Matplotlib 代码生成,以提升数值准确性。

不要错过真正重要的内容

持续关注 AI 动态。清晰、实用,不过度渲染。

AI 社区与洞察

关注 The Decoder,获取 AI 新闻、背景报道和专家分析。

Newsletter - THE DECODER

持续关注 AI 动态。清晰、实用,不过度渲染。

参与讨论

正在确认登录状态…