当前位置：首页 » 资讯 » 新科技 » 正文

AI进化时间表已现！LLM每7个月能力翻倍，2030年职场不复存在？

IP属地中国·北京 编辑：冯璃月新智元 时间：2025-07-14 20:17:34

新智元报道
编辑：海狸
LLM正以前所未有的速度进化：METR发现，它们的智能每7个月就翻一番。到了2030年，一个模型可能只需几小时，就能搞定人类工程师几个月的工作。别眨眼，你的岗位或许已在倒计时中。
随着大模型能力一路狂飙，各路测评基准也遍地开花。
从经典的MMLU、HellaSwag，到多模态方向的MMMU、MathVista，再到AGI风格的Arena对决、Agent任务、Tool-use测试。
如何科学地衡量LLM在长时、复杂、真实世界任务中的能力，至关重要。
今年3月，METR发布重磅研究《MeasuringAIAbility to Complete Long Tasks》，首次提出令人眼前一亮的新指标：
50%任务完成时间视野（50%-task-completion time horizon）
——也就是：AI能以50%成功率完成的任务，人类通常需要花多久？

论文链接：https://arxiv.org/pdf/2503.14499
据此，METR展开了一系列研究，包括任务复杂度设定、人类基准时间测量、多模型对比实验到层层统计回归建模。
最终，团队精准量化了AI智力演进速度，并抛出惊人预测：
按照目前增长速度，5年之后，大模型可能就能在一天内自动完成原本需要人类数月才能完成的复杂任务。
别眨眼，LLM每7个月实力翻倍！
METR团队选出每一时间段的最强模型，建立了一个精确的「大事年表」，进一步定量分析模型能力随时间的增长情况。

结果显示出清晰的指数增长趋势：在过去的六年中，模型能力每7个月翻一番。
图中的阴影区域表示通过在任务家族、任务以及任务尝试之间进行分层自助法（hierarchical bootstrap），计算得出95%的置信区间。
不过，这个指数增长趋势非常陡峭，所以于对误差有很高的容忍度。
即便绝对测量误差达到10倍，能力到来的时间也仅会改变大约2年左右。
因此，团队对不同能力何时出现的预测基本不会出错。
模型vs人类：用「人类耗时」测量大模型智力
METR这项研究的核心就是他们提出的这项指标：「任务完成时间视野」（task-completion time horizon）。
这个指标相当于给分别完成任务的人和AI加了个映射：
想象一组各不相同的任务，人类完成这些任务分别需要不同的时间。
把这些任务交给AI模型去做，然后找出AI能以50%成功率完成的那一档任务（但不考虑AI用的时间）。
然后对应去看人类完成这一档任务通常需要多长时间。
这个人类所需的时间，就是该模型的50%-task-completion time horizon，也即「任务完成时间视野」。

为了证明这个基准的有效性，METR团队做了翔实的统计分析。
结果显示，人类基线完成某项任务所需时间，与各模型在该任务上的平均成功率之间存在负相关关系。
简而言之，人做起来越慢，模型做起来越容易失败。
并且，用指数模型拟合这个负相关趋势效果很好。
用模型成功率对人类完成时间的对数做回归分析，算出的R²约为0.83，相关系数为0.91，这比不同模型之间平均成功率的相关系数还高。

因此，「以人类时间衡量任务难度」，这个指标非常合理。
模型越新，任务越难：能力进化有迹可循
证明了这个指标的有效性，接下来还要看看各个模型在这个指标上的表现。
团队进一步检验了不同模型能完成的任务所对应的人类耗时。
结果相当符合直觉：
2023年之前的模型（如GPT-2和GPT-3）只能完成那些只需写几句话的简单任务。
而对于人类耗时超过1分钟的任务，它们则迅速败下阵来。

相比之下，最新的前沿模型（如Claude 3.5 Sonnet和o1）则可以完成一些人类要花数小时的任务，甚至在十几小时的超长程任务上还能保持一定的成功率。

效率碾压人类：2030年警告已拉响
按照「7个月翻一番」的这个速度下去，METR团队得到了一个惊人结论：
到2030年，最先进的LLM有望以50%的可靠性，完成一个每周工作40小时的人类工程师花一个月才能完成的任务。
更令人毛骨悚然的是， LLM的速度可能远超人类——也许只需几天，甚至几小时。
到2030年，LLM可能已经能轻松创办一家公司、写出一部像样的小说，或是大幅改进已有的大模型。
AI研究员Zach Stein-Perlman在博客中写道，拥有此类能力的LLM的问世将带来巨大的影响，无论是潜在好处还是潜在风险」。

Kinniment承认，LLM能力翻倍的速度让人害怕，仿佛科幻片灾难前奏。
但她也表示，在现实中也可能有很多因素影响和减缓这种进展。AI再聪明，仍然可能受到硬件、机器人技术等瓶颈的掣肘。
参考资料：
https://spectrum.ieee.org/large-language-model-performance

免责声明：本网信息来自于互联网，目的在于传递更多信息，并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益，请及时联系我们，本站将会在24小时内处理完毕。

同类资讯

腾讯副总裁谈“龙虾”：大幅提振B端AI意愿

AI重塑教学，算力赋能育才！华为探寻教育数智化转型新路径

鲲鹏+凌川科技SL200，用极致算力为互联网视频产业带来质变

华为云发布FlexNPU，打造弹性伸缩的“算力金箍棒”

资本与技术的双重博弈：OpenAI天量融资的启示与思考

华为天才少年为何纷纷转战机器人赛道？

全站最新

腾讯副总裁谈“龙虾”：大幅提振B端AI意愿

AI重塑教学，算力赋能育才！华为探寻教育数智化转型新路径

鲲鹏+凌川科技SL200，用极致算力为互联网视频产业带来质变

华为云发布FlexNPU，打造弹性伸缩的“算力金箍棒”

热门推荐

Patagonia关联公司曾因虚假宣传被罚

皖能电力旗下新能创业投资公司增资至78.2亿增幅约104%

连云港安防产业专项母基金成立出资额10亿

鞠婧祎名下关联2家企业

华为发起维权诉讼索赔百万

歌尔股份旗下潍坊电子公司增资至约18.7亿

张小帆卸任东风特种商用车公司董事长

男子坠亡涉事俱乐部事发时刚成立2个月

鞠婧祎涨粉14万

卜凡团博关联公司成立不足一年

灵心巧手增资至9.2亿

东方电气集团国际合作公司增资至10亿增幅约31%

天津脑机接口产业集团登记成立注册资本10亿

鞠婧祎回应税务情况当日涨粉3万

中国农机加速迈向全球市场，现存农业机械相关企业超286万家