当前位置: 首页 » 资讯 » 新科技 » 正文

数据侦探能通关吗?香港科技大学团队造了一个"密室逃脱"来考验AI

IP属地 中国·北京 科技行者 时间:2026-08-22 00:54:26


这项研究由香港科技大学(广州)联合清华大学的研究团队共同完成,发表于2026年8月,论文题目为《DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces》,论文编号为arXiv:2608.03451v1 [cs.AI]。这项研究同时也是KDD Cup 2026"复杂数据分析数据智能体"竞赛的官方评测基准。感兴趣的读者可以通过这个编号在arXiv网站上查询到完整论文。

先说一个场景。假设你是一名基金公司的分析师,老板突然问你:"哪些基金在2023年跑赢了行业基准,同时又触发了我们那份风控视频里定义的最大回撤警报?把基金名称、类别、回报率、基准、最大回撤和严重程度排名都给我列出来。"

这个问题听起来简单,但要回答它,你得打开五六个完全不同的文件:一份记录基金分类的JSON文件,一份两千多行的CSV表格,一个存了两年每日净值数据的数据库,一份九十多页的PDF基准报告,还有一段八分多钟的风控简报视频。你需要从视频里听出警报的触发条件是"最大回撤不超过12%",从PDF里翻出每个类别的基准收益率,从数据库里查出每日净值再计算实际回撤,最后把这些散落在不同地方、不同语言、不同格式的信息拼接起来,才能给出老板要的那张完整表格。

这正是香港科技大学(广州)团队想要考验人工智能"数据智能体"(可以理解为一个能自主查资料、算数据、写报告的AI助手)的场景。他们发现,现在市面上评测这类AI助手的"考试题",大多只考察某一项单独的能力——有的只考数据库查询,有的只考文档阅读理解,很少有测试要求AI像真正的分析师一样,在一堆杂乱无章、多语言混杂的文件堆里,自己去发现线索、拼凑证据、算出答案,还要交出一份格式规范、内容完整、可以直接核对对错的表格。于是他们造了一个新的"考场",取名DataSpace,中文可以理解为"数据空间"。这个考场里放了410道题目,配套了7439个各种类型的文件,总容量约15GB,涵盖CSV表格、JSON文件、SQLite数据库、Markdown文档、PDF文件和视频六种载体,题目和资料里还经常混杂中文和英文。他们用这套考场测试了六款目前最先进的多模态大模型和五种常见的AI助手运行框架,结果发现,即便是表现最好的组合,正确率也只有66.34%,远没有到"通关"的水平。

接下来,我们就用侦探破案的方式,把这项研究从头到尾讲一遍——研究者们是怎么造出这个考场的,AI侦探们又是怎么在里面栽跟头的。

一、案发现场:为什么现有的考场都不够真实

要理解DataSpace这个新考场的价值,得先看看之前的考场都长什么样。

在这项研究之前,AI数据分析能力的测试大体分成三类。第一类叫"结构化数据测试",比如Spider和BIRD这两个知名基准,它们的套路是给AI一个明确的数据库,让AI把自然语言问题翻译成SQL查询语句去查数据库。这类测试的好处是答案可以精确核对——查询语句执行完,结果对不对一目了然。但问题在于,考官提前就把案发现场(也就是要查的数据库)指给AI看了,AI不需要自己去找证据,只需要专心破解一道"翻译题"。

第二类叫"非结构化数据测试",比如MMLongBench-Doc,专门考验AI阅读又长又复杂的文档、图表的能力。这类测试更贴近真实世界里证据散落各处的情况,但它们通常只要求AI给出一个简短的答案,比如一个数字或几个词,而不是一整张需要精确对齐每一行每一列的完整表格。

第三类叫"数据智能体测试",比较接近DataSpace的思路,比如KramaBench考察AI从数据湖(也就是一堆杂乱堆放的数据文件)里提炼洞见的能力,FDABench进一步把文档和多媒体也纳入进来。这类测试已经开始让AI自己去"案发现场"找线索,但它们对"最终答案应该是什么样子"这件事的要求五花八门——有的要一个选择题答案,有的要一份分析报告,有的要一段可执行的代码,评判标准也经常需要靠另一个AI来打分,而不是靠精确的程序化核对。

研究团队把这些考场放在一起比较,发现它们始终没能同时具备三个特质。第一个特质是"考场范围",也就是题目相关的证据应该分散在数据库、结构化文件、长文档和多媒体资料里,而且题目本身和资料内容都可能混杂着不同的语言。第二个特质是"答案契约",也就是AI必须交出一份完整、精确的分析结果表格,而不是一个简单的事实性答案、一段处理流程,或者一篇开放式报告。第三个特质是"评判方式",也就是评分系统必须是确定性的、不依赖另一个AI主观打分的,同时又要能容忍那些形式不同但本质等价的答案(比如列的顺序换了,或者数字的写法不一样),同时坚决拒绝不完整或错误的答案。

DataSpace就是奔着同时满足这三个特质而造的。它的题目由410个跨语言任务组成,涉及基金、股票、宏观经济和医疗健康四个领域,工作空间里混合了CSV、JSON、SQLite、Markdown、PDF和视频六种载体,组合方式多达十三种,题目和资料里中英文交织出现。每一道题都配有一份完整的、经过验证的标准答案表格。

二、造案:怎么从一堆真实的数据库题目"变形"出这410道谜题

造出这样一个考场并不容易。研究团队的思路很巧妙——他们没有从零开始编题,而是找到了两个现成的、质量可靠的英文数据库查询题库,一个叫EHRSQL(专注医疗记录分析),一个叫BULL(专注金融分析)。这两个题库的好处是,每道题都配有一个真实的数据库和一条可以直接跑通的SQL查询语句,这就为后续的"变形"提供了坚实的地基。

整个变形过程由一套叫DataSpace-Builder的流水线完成,分成四个阶段。

**第一阶段:跨语言变身。**原始题库里,问题和数据库都是清一色的英文。研究团队要做的是让问题和数据库分别"穿上"不同语言的外衣——问题可以用中文问,数据库里的字段名和内容可以是另一种语言状态。这听起来简单,但暗藏陷阱:如果孤立地翻译问题,或者孤立地翻译数据库,很容易出现"张冠李戴"的情况,比如同一个病人的名字在数据库的两个表里被翻译成了两个不同的名字,导致原本能关联起来的信息对不上了。

为了避免这种问题,研究团队设计了一套"关联感知"的翻译机制。他们会先找出数据库里哪些字段其实指的是同一件事——比如通过外键关系连起来的两列,或者名字相同的两列,又或者取值范围高度重合的两列(这种"隐藏关联"通过计算两列取值的重叠比例来发现,重叠得足够多且共同值足够多才会被认定为关联)。找出这些关联组之后,同一组里的所有值会被当作一个整体一起翻译,确保"病人"这个词无论出现在哪张表里,翻译出来都是同一个词。而那些不该被翻译的内容——比如身份证号、网址、日期、纯数字——会被识别出来并原样保留。

翻译完成后,系统会用两道"验尸"程序来确认变身是否成功。第一道是执行检验:把翻译后的SQL语句放到翻译后的数据库里跑一遍,得到的结果必须和原始结果(经过同样的翻译映射后)完全一致,包括结果的行数和重复次数都要对得上。第二道是意图检验:用一个AI来核对翻译后的问题是否还保留着原来的意思,有没有在翻译过程中不小心改变了要问的东西。只有两道检验都通过,这道题才能进入下一阶段。

**第二阶段:证据布置(约束感知的关系抽样)。**原始题库里,很多不同的题目其实共享同一个数据库,如果直接拿来用,会导致整个考场里出现大量重复的实体和数值,题目之间"串味"严重。研究团队于是决定给每道题单独定制一个"案发现场"——从原始数据库里抽取一部分行,组成一个规模适中、专属于这道题的小型数据库实例。

但这里有个技术难题:如果对每张表分别独立抽样,很可能一不小心就把某个查询条件依赖的关键行给漏掉了,或者把两张表之间的关联链条抽断了。打个比方,如果一道题要查"某个特定客户的所有交易记录",但抽样时恰好没抽到那个客户在客户信息表里的那一行,题目就变得无解了。

为了避免这种"案发现场被破坏"的情况,研究团队设计了一套"抽样安全网"。这套安全网会先从原始SQL语句的语法结构里,提取出所有必须保留的关键信息——包括主键外键关系、查询条件里用到的具体数值、区间边界值,以及被明确点名提到的实体。抽样时,这些被安全网圈定的行会被优先、完整地保留下来,然后系统会顺着表与表之间的关联关系,把这些关键行相关联的其他行也一并找出来补充进去(比如保留了一条订单记录,就会顺带把这条订单对应的客户信息也保留下来),这个过程被称为"关系闭包"。剩下的抽样名额,则按照每张表设定的规模预算随机补充,即便是SQL语句本身没有直接用到的表,也会被适量保留在数据库里,增加干扰项的真实感。

抽样完成后,系统会把选中的行重新组装成一个完整的、独立的小型SQLite数据库,并在这个新数据库上重新执行一遍SQL查询,得到一个全新的候选标准答案。需要特别说明的是,这个新答案完全可能和原始题库里的答案不一样——因为抽样改变了具体涉及哪些实体、聚合出的数值、排名结果甚至结果的行数,这都是正常且允许的,只要新答案是在新数据库上真实、有效执行得出的即可。只有当SQL执行成功、必要的关联关系依然完整、结果没有意外变成空集或退化成没有意义的形式,这次抽样才算通过,否则就要重新抽样、修复或者直接放弃这道题。

**第三阶段:证据分装(模态路由与素材渲染)。**这一步是整个流水线里最有创意的部分——它决定了同一份数据究竟要以什么"外形"出现在考场里。

对于每一张被抽样出来的表,系统会先用一个不考虑具体题目内容的、只看表结构特征的规则策略,给它分配一种或多种合适的呈现方式。基础的呈现方式包括CSV表格、JSON文件、SQLite数据库、Markdown文档和PDF文件。规则策略会综合考虑这张表的结构特点(比如是不是扁平的、有没有声明的主键)、每种渲染方式的适配程度,以及整个考场里各种呈现方式的比例是否均衡,来做出选择。每张被抽样的表都至少会得到一种成功的呈现方式,而实际生成出来的文件数量和大小,则完全取决于原始表的规模和适用的渲染方式,并不是刻意设计成某个固定的数字。

其中,把表格数据转换成一份"看起来很真实"的长文档(Markdown或PDF),是一个特别精细的工序。系统会先让AI扮演一个"报告策划师",判断这份数据最适合写成什么风格的文档——是像病历记录一样的事件流水账,还是像审计报告一样的财务陈述,或者是像工作简报一样的运营总结。接着,AI会挑出能唯一标识每一行数据的"锚点列"(比如订单编号),把其余列按照语义相近的原则分成几个组,再把行按照生成预算切分成若干批次。

真正生成文字内容时,系统会把原始数据的每一个非空单元格都标记上一个内部编号,要求AI在写作时必须把每个编号对应的事实准确地表达出来——姓名、编号、数字、日期、单位这些关键信息必须原封不动地保留精确度,不能张冠李戴,也不能把两行不同记录的数据混在一起说。AI可以自由发挥的部分,只限于连接词、场景描写这类不影响事实的"装饰性"文字。生成完成后,系统会用一套验证程序逐一核对生成的文字里,每个被标记的事实是否都被准确无误地表达了出来,如果发现遗漏或者表达错误,这一段文字就会被要求重新生成。

为了增加题目的难度层次,系统还引入了三种"调味"手段。第一种是让报告的细节层层递进、逐渐深入,第二种是灵活决定缺失的数据应该明确说明"此项缺失"还是干脆略去不提,第三种是给部分内容段落添加一些和主题相关的背景叙述,甚至采用"先说错、再纠正"的写法来增加干扰,但无论怎么调味,核心的、必须保留的事实数据都不能被这些"调味料"覆盖或替换掉。

而视频这种呈现方式,则和其他几种完全不同——它不是针对单张表格的通用渲染,而是专门针对某道具体题目量身定制的"证据视频",制作过程需要参考这道题的问题内容、SQL查询逻辑以及计算出的候选答案。这个环节借鉴了此前另一项名为DataMagic的研究成果,把表格数据转换成"数据洞察视频"。系统会先从SQL语句和候选答案里,识别出两类可以做成视频证据的"原子信息":一类是筛选条件(比如某个字段必须大于某个数值才算通过筛选),另一类是结果单元格(具体的某行某列对应的数值)。

针对这两类原子信息,视频渲染有两种策略。第一种叫"条件抽取",专门用于那种涉及多个步骤的复杂查询——把其中一个或几个稳定的筛选条件从问题文字里抽走,转移到视频画面里表达,比如做成一个"配置面板"的样子,显示某个警报的触发规则是什么。第二种叫"答案证据分布",专门用于那种结果比较紧凑简洁的查询——把结果里的某些具体数值,拆分到视频的不同画面或不同时间点里展示,而不是简单地把整张结果表格直接摊开展示,这样能避免AI"偷懒"直接抄视频里的现成答案表格。无论采用哪种策略,题目文字只有在证据确实被转移到视频里之后才会做相应的调整,而且调整只针对被转移的那部分,题目要求的其他方面(比如要哪些字段、要不要排序)都保持不变。

**第四阶段:专家验尸(人工复核与题目修复)。**前面三个阶段的各种技术性检验,只能确保数据和SQL之间是自洽的,但无法判断一道题本身是不是清晰无歧义,也无法确认标准答案是不是真的正确。这就需要真人专家出马了。

研究团队组建了一个由11位相关领域专家组成的评审团,每道候选题目都会被指派给至少两位互不知情的评审人。评审过程分成两个阶段进行,带有严格的"信息屏蔽"机制。第一阶段是"盲测阶段":评审人只能看到题目最终的问题文字和完整的资料库,他们要像真正的AI一样,自己动手在资料库里找线索、算答案,提交一份自己认为正确的候选答案,并且必须为答案标注具体的证据来源(是从哪个文件、哪一行、哪一页找到的支撑依据)。在这个阶段,评审人完全看不到标准答案、也看不到搭档评审人的答案。第二阶段是"核实阶段":只有当评审人完成并锁定了自己在第一阶段的独立答案之后,系统才会向他解锁真正的标准答案,让他核对自己算的对不对,并独立地为这道题撰写一套"评分规则说明"——包括每一列应该是什么数据类型、数字要保留几位小数、结果的行是否需要按特定顺序排列等等。

只有当两位评审人在标准答案的判定上完全一致,并且各自独立写出的评分规则说明也完全相同时,这道题才算通过审核。一旦出现分歧——不管是对答案本身的分歧,还是对评分细节的分歧——都会触发"证据讨论"环节,评审人需要引用工作空间里具体的证据位置来说明自己的判断依据,双方协商后对题目的问题、资料、标准答案或评分规则中的任意部分进行最小幅度的修复,然后再重新独立核查一遍,如此循环直到达成共识为止。如果反复讨论后依然无法达成一致,这道题就会被直接从考场里剔除。

三、验尸报告:这个考场到底装了些什么

经过这四道流水线加工,最终留下的410道题目呈现出这样的面貌。从来源上看,363道(占88.5%)来自金融题库BULL,47道(占11.5%)来自医疗题库EHRSQL。从主题分布看,基金相关题目158道(38.5%),股票相关120道(29.3%),宏观经济85道(20.7%),医疗健康47道(11.5%)。从语言构成看,265道(64.6%)属于跨语言题目,145道(35.4%)是单语言题目。

这些题目背后的资料库规模相当可观:合计25384页PDF文档,5536万字符的PDF和Markdown文字内容,以及5.49小时的视频时长。标准答案的总行数达到126409行,其中规模最大的一道题答案有12962行,最宽的答案表格有六列,92道题要求答案必须按照特定顺序排列(不能随意打乱行的顺序)。

更有意思的是,研究团队专门为每道题标注了一条"最省力但足够充分"的解题路径,以此区分"工作空间里存在什么资料"和"解这道题真正必须用到什么资料"这两件事。结果发现,CSV文件在每一道题的工作空间里都会出现,JSON、SQLite、Markdown、PDF这四种资料出现的比例也都超过93%,但真正被验证为必须用到的解题路径中,只有58道题用到了CSV,177道题用到了SQLite。长文档在135道题里是解题的必需证据,而在189个配备了视频的工作空间中,97道题必须依赖视频才能解出来。

这说明一个重要的现象:资料摆在那里,不代表非用不可。很多资料其实是"干扰项",故意混在真正有用的证据旁边,考验AI能不能分辨出哪些是真正的线索,哪些只是烟雾弹。

从证据的组合方式来看,276道题(67.3%)的解题路径只用到了一种资料类型,115道(28.0%)用到两种,19道(4.6%)用到三种——合计134道题(32.7%)需要跨模态整合信息才能解题。如果按"资料家族"划分(把CSV和JSON归为结构化文件家族,SQLite归为数据库家族,Markdown和PDF归为文档家族,视频单独算一类家族),129道题(31.5%)需要跨越多个家族才能凑齐证据,202道题(49.3%)必须依赖文档或视频。

在分析操作类型上,投影(也就是从多列中挑选出需要展示的列)和筛选(按条件过滤数据行)是最常见的操作,分别出现在338道(82.4%)和321道(78.3%)题目里。排序操作出现在209道题(51.0%)里,聚合运算(求和、平均等)出现在146道(35.6%)里,表连接操作出现在113道(27.6%)里。跨资料的证据整合方面,文档理解和视频理解各自出现在135道和97道题里,模式对齐(把不同数据源里名称不同但实际指同一件事的字段对应起来)和实体对齐(识别不同数据源里指代同一个具体对象的记录)分别出现在97道和90道题里。

从复合难度来看,一道题平均需要综合运用五种不同类型的分析操作,90%的题目需要用到七种或更少的操作类型,60.5%的题目至少要综合运用五种操作类型才能解开。这意味着DataSpace里的题目普遍不是"单点考察",而是要求AI像真正的分析师一样,把多种技能揉在一起综合运用。

四、开考!六位AI侦探的成绩单

准备好考场之后,研究团队请来了六位"AI侦探"参加考试——分别是Grok 4.5、GPT-5.6 Sol、Kimi K3、MiMo-V2.5、Claude Sonnet 5和MiniMax M3,这些都是2026年4月到7月之间陆续发布的前沿多模态大模型。为了保证公平竞争,研究团队特意搭建了一个轻量级的"标准作案工具箱",叫DataSpace-Agent,它遵循一种叫ReAct的经典行动模式(简单理解就是"思考一步、行动一步、观察结果、再思考下一步"的循环),配备了浏览文件、查数据库、跑代码、看视频等基础工具,但不针对任何具体题目做特殊优化。六位AI侦探都使用同一套工具箱,只是各自的"大脑"(也就是背后的大模型)不同,这样就能公平地比较谁的"脑子"更聪明。

考试结果显示,Grok 4.5拿下了最高的正确率66.34%,紧随其后的是GPT-5.6 Sol,正确率64.63%,两者的差距其实只有7道题。Kimi K3排在第三,正确率53.41%。剩下的三位选手——MiMo-V2.5、Claude Sonnet 5和MiniMax M3——正确率都没能突破40%,分别是39.27%、32.93%和28.54%。最强和最弱选手之间的差距达到37.80个百分点,说明模型之间的实力确实存在明显差距。

但更值得关注的是另一组数据:六位AI侦探里,有56道题是所有人都答对的"送分题",却有76道题是所有人都答错的"绝命难题"。即便把六位AI侦探答对的题目全部并起来算作"团体最强表现",也只能覆盖334道题(占81.46%)。这意味着,即便是目前最先进的AI组合,依然有近两成的题目是集体束手无策的,DataSpace这个考场还远远没有被"通关"。

研究团队还做了另一组对照实验,这次固定住"脑子"(统一使用MiMo-V2.5这个模型),换成五种不同的"作案工具箱"——除了他们自己设计的DataSpace-Agent,还测试了业界流行的Smolagents、Codex、Claude Code和Grok Build。结果发现,Grok Build拿到46.34%的正确率,Claude Code紧随其后是44.63%,DataSpace-Agent本身是39.27%,Codex是34.88%,Smolagents垫底,是30.98%。也就是说,即便用的是同一个大脑,换一套不同的工具箱和思考流程,正确率也能相差多达15.36个百分点。这说明,一个AI侦探的破案能力,不仅取决于它脑子聪不聪明,还取决于它手里的工具用得顺不顺、思考流程设计得合不合理。

五、破案效率:谁是又快又准的高手,谁又是费力不讨好的笨探员

光看正确率还不够全面,研究团队还统计了每位AI侦探破案过程中的资源消耗——花了多少"思考文字量"(用词元数衡量,可以理解为AI每次思考和输出所消耗的文字总量)、花了多少美元的调用成本、进行了多少次工具操作、花了多长时间。

对比下来,GPT-5.6 Sol展现出一种"少花钱多办事"的特质:它的正确率64.63%只比冠军Grok 4.5低了1.71个百分点,但它消耗的词元数量却少了74.2%,进行的工具操作次数少了50.3%,耗费的实际时间也少了39.2%。换句话说,GPT-5.6Sol几乎用了四分之一的力气,达到了接近顶尖的水准,是效率上的一大亮点。

而在花钱这件事上,情况又完全不一样。MiMo-V2.5每道题只花费0.011美元,是六位选手里最省钱的,尽管它的正确率只有39.27%。相比之下,Grok 4.5每道题的花费是0.169美元,GPT-5.6 Sol更是要花0.200美元。这说明想要"既准又便宜",现阶段还很难面面俱到——追求高正确率往往意味着要多花钱,而想要省钱又常常意味着要牺牲一定的准确性。

六、案情深挖:什么样的题目最容易把AI侦探绊倒

为了搞清楚AI侦探到底在什么类型的题目上更容易犯错,研究团队把这410道题目按照各种特征分类,逐一比较每种特征下六位AI侦探的正确率变化。这部分分析属于"观察性描述",不代表严格的因果关系,但依然能勾勒出一些有价值的规律。

先看语言这个维度。跨语言题目对不同AI侦探的影响很不统一——相比单语言题目,MiMo-V2.5在跨语言题目上的正确率下降了11.8个百分点,Grok 4.5下降了5.1个百分点,但GPT-5.6 Sol和Claude Sonnet 5反而分别提升了6.1和7.2个百分点。这说明语言切换这件事对不同AI侦探的影响是"因人而异"的,没有一条放之四海而皆准的规律。

再看资料规模这个维度。工作空间规模最大的那一档题目,对所有六位AI侦探的正确率都造成了负面影响,但从最小到最大的四个规模档次里,正确率的变化并不是简单的一路下滑——这说明单纯的"资料多不多"并不能直接决定题目的难易程度,真正影响难度的往往是资料背后的逻辑复杂度,而不是资料的物理体量。事实上,如果单独计算工作空间的文件总大小和"多少个模型能解出这道题"之间的相关性,只能得到一个微弱的负相关(数值为负0.186),说明"资料越大越难"这个直觉并不完全准确。

第三个维度是证据的模态组成,这是整个分析中最一致、最值得警惕的发现。需要跨模态整合信息的题目(也就是必须同时从两种以上不同类型的资料里凑齐证据的题目),对所有六位AI侦探来说都比单一模态的题目更难,降幅在1.8到14.0个百分点之间,没有一个例外。但如果只看"某种特定资料是否存在"这个更细的角度,规律就变得不那么统一了——需要用到长文档证据这件事,对GPT和Kimi几乎没有影响,但会显著拖累Grok、MiMo、Claude和MiniMax的表现;而需要用到视频证据这件事,反而对GPT和Kimi有帮助,却会拖累MiMo、Claude和MiniMax。这些差异说明,真正一致的难点在于"如何把不同模态的证据整合到一起",而不在于某一种模态本身特别难处理。

第四个维度是需要用到表连接操作的题目。这类题目对所有六位AI侦探来说无一例外都更难,正确率降幅在9.7到19.8个百分点之间,是本次统计里少有的"放之四海而皆准"的规律。而聚合运算(求和、平均等)则表现得比较复杂,对不同AI侦探的影响正负不一。

最后是答案的形态。答案是多行还是单行、多列还是单列、是否需要按特定顺序排列,这些因素对不同AI侦探的影响同样呈现出"因人而异"的复杂图景——多行答案会拖累Grok和MiMo的表现,却反而提升了Claude的表现;而多列答案和需要排序的答案,整体上并没有表现得更难。这说明,答案表格本身的"个头大小"并不是决定难度的关键变量,真正决定难度的还是背后的分析逻辑和证据整合路径。

综合来看,跨模态证据整合和表连接操作,是六位AI侦探集体最容易栽跟头的两个"坑",这个结论对所有测试模型都是一致的、稳定的,而语言选择和答案形态这些因素则表现得因模型而异,没有普遍规律。

七、案卷复盘:AI侦探到底是怎么翻车的

为了更深入地理解错误究竟发生在哪个环节,研究团队对表现最好的Grok 4.5,专门挑选出136道它做错的题目,逐一进行了细致的"案卷复盘"——追踪它在解题过程中每一步的操作记录,找出错误究竟从哪个环节开始出现偏差。

复盘结果显示,最大的翻车原因出在"最后一步的答案组装环节",占到全部错误的52.2%(71道题)。具体来说,其中60道题是因为AI已经在内部正确地算出了应该有的结果,但在最后组装成表格提交时,却多加了或者漏掉了某些列——比如题目要求六列,AI心里的答案是对的,但最后交上来的表格却是五列或七列。这就好比一位侦探已经找到了真凶,却在最后写结案报告时漏写了关键证物清单。

第二大类翻车原因是"审题环节的意图理解错误",占22.8%(31道题)。具体来说,17道题是因为AI一开始就误解了题目到底要求返回什么样的数据、什么粒度的记录,还有一部分是误解了筛选条件、时间范围或者排序要求。这两大类合起来占了错误总数的56.6%,说明超过一半的翻车,根本原因不是AI没找到证据、没算对数字,而是它没能准确理解"应该交出一份什么样的答卷"。

相比之下,选错资料来源这种"找错案发现场"的低级错误只占极小比例,只有3道题;而信息提取和语义理解方面的问题合计也只有21道题,说明"找到正确的文件"和"从文件里准确读出正确的数值并正确关联"是两个不同层次的挑战,后者远比前者更容易出岔子。

研究团队还特别指出一个有意思的现象:同一种"翻车表现"(也就是最终评分系统看到的错误症状),背后的真正病因可能完全不同。比方说,在被审计的74道"列数不对"的错误里,有58道确实是最后组装表格环节出的问题,但剩下的16道其实源头是更早期的审题理解、信息提取、语义关联或者计算环节的问题,只是这些早期错误最终表现成了"列数不对"的症状。反过来看,在13道"AI根本没交答案"的情况里,只有5道是纯粹因为AI在规定时间或步数内没能收尾;另外8道则是更早的持续性理解、提取、关联或计算错误一直没被纠正,导致AI最终卡壳交不出答案。这说明,单纯看最终的错误表现,很容易误判真正需要修复的环节——就像医生看到病人发烧,不能仅凭"发烧"这个表面症状就断定病因,还得深入检查才能找到真正的病灶。

结语:这场"密室逃脱"揭示了什么

说到底,DataSpace这个考场揭示的核心信息是:当前最先进的AI数据分析助手,在面对真实世界里那种资料杂乱、语言混杂、证据分散的分析任务时,离真正"靠谱"还有相当长的一段路要走。即便是表现最好的组合,正确率也只有66.34%,意味着差不多每三道题就有一道会做错;而76道所有AI都答不出来的"绝命难题"更是说明,现在的AI侦探集体还有一些盲区没有攻克。

从这项研究里可以提炼出几个特别值得记住的发现。第一,选对"作案工具箱"(也就是AI助手的运行框架)和选对"大脑"(也就是背后的大模型)同样重要,一套设计精良的工具箱能在同一个大脑的基础上把正确率拉高十几个百分点。第二,跨模态整合证据和表连接操作是所有AI侦探不约而同的软肋,这提示未来的AI助手开发者应该把更多精力投入到"如何让AI稳定地把不同来源、不同形式的证据拼接到一起"这件事上。第三,很多错误的根源并不在于AI"没找到"或"没算对"证据,而在于它没能准确理解题目到底要求交出什么样的答卷,或者在最后组装答案表格时出了岔子——这提示,让AI"忠实、精确地交付用户真正要求的结果",可能比让它"更聪明地解题"更值得优先解决。

对于普通人来说,这项研究的意义在于:它提醒我们,虽然AI助手在很多场景下已经能帮我们处理一部分数据分析工作,但如果任务本身涉及多种资料来源、需要跨文件跨格式整合信息,现阶段的AI依然容易出错,人工核对和把关仍然是必不可少的一环。这也解释了为什么很多企业在引入AI数据分析工具时,依然会保留人工复核的环节——不是因为AI完全不可靠,而是因为在复杂、真实的工作场景里,AI犯错的方式往往出人意料,需要人来兜底。

这项研究已经把全部410道题目的输入资料公开发布,其中60道题连同标准答案和评分规则也一并开放,供研究者在本地进行端到端的测试,剩下的350道题的标准答案则被保留用于官方的完整评测,以防止被提前"泄题"训练出针对性的应对策略。如果你对这项研究的技术细节感兴趣,欢迎通过论文编号arXiv:2608.03451v1查询完整原文,里面还有更多关于跨语言变身、抽样安全网、视频渲染等环节的技术细节可以深入了解。

Q&A

Q1:DataSpace是什么?

A:DataSpace是由香港科技大学(广州)联合清华大学团队打造的一个AI能力测试基准,用来考验数据智能体在杂乱、多语言、多类型文件混合的工作环境中自主查找证据、整合信息并给出完整准确表格答案的能力,包含410道跨语言任务和超过7000个测试文件。

Q2:DataSpace测试结果显示AI表现如何?

A:在测试的六款前沿多模态大模型中,表现最好的Grok 4.5正确率也只有66.34%,说明AI数据分析助手还远没有达到完全可靠的水平,尤其在需要整合视频、文档、数据库等多种资料类型的题目上普遍容易出错。

Q3:AI在DataSpace测试中最容易在哪些地方出错?

A:研究发现两个最容易导致AI翻车的因素,一是需要同时从多种不同类型资料(比如文档加视频加数据库)里凑齐证据的跨模态题目,二是需要进行表连接操作的题目,这两类题目对所有测试模型都造成了明显更差的表现。此外,超过一半的错误其实源于AI没有准确理解题目要求返回什么样的答案格式,而不是没找到或没算对数据本身。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。