官方表示,Ling-3.0-flash-Fin 在蚂蚁集团与中金公司联合打造的 FinFIRST、以及 FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking 等金融智能体基准上进行了测试,覆盖金融信息检索、投资研究分析、金融长程任务执行、估值建模、银行业务应用等场景。
据公开的基准测试数据,该模型在Agentic terminal coding测试中得分73.0(Qwen3.6-27B为63.4),在SWE-bench Pro测试中得分61.7(Qwen3.6-27B为53.5),在专业工作任务测试JobBench中得分33.4,较Qwen3.6-27B的21.8提升约50%。
当地时间8月13日,谷歌发布新模型Gemini 3.7 Flash,相比性能提升,更受开发者关注的是一项限时促销:今年年底前,该模型每百万token的输入、输出价格分别为0.75美元和3.75美元,只有Gemini 3.6 Flash标准价格的一半。
智谱表示,在多项主流基准测试中 GLM-5.3 是当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。
IT之家 8 月 13 日消息,韩国人工智能实验室 Upstage 今天(8 月 13 日)发布博文,宣布推出 Solar Pro 4 模型,定位为面向复杂 AI 智能体任务的商用大模型。
受访团队提供了多个生产案例:1 家 CPG(消费品)数据平台每月运行约 1500 万至 2000 万次自动化门户交互,将智能体作为手写爬虫的自愈备用方案。
满血版N1X采用20核CPU加6144核Blackwell GPU的配置,CPU集群为10+10结构,基础频率4.0GHz,搭配64GB内存,单核得分2570,多核得分23126。
本次一共纳入10款主流国产办公AI,全部产品三次测试平均分都突破91分,整体水准大幅提升,百度文心助手拿下总分第一,小米MiMo Claw位列第二。
这次测评和以前不一样,把传统代码生成升级成智能体编程,权重直接给到25%,更贴合程序员真实开发流程。
全高清模式下,文本转视频或图像转视频每秒收费 0.29 美元(现汇率约合 2 元人民币),视频转视频每秒收费 0.53 美元(现汇率约合 3.6 元人民币)。
在未调整优化前,GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的得分为 7.8%,而 GPT-5.5 模型的得分只有 0.4%。
OpenAI改进GPT-5.6 Sol,ARC-AGI-3得分大涨188%
性价比之王要打 Agent 仗了
马斯克发Grok新模型!登智能体测评榜首,比OpenAI家便宜一半
技术路线新突破:阿里云开源发布0.8B文档解析模型OvisOCR2
OpenAI Codex、ChatGPT Work暂时取消部分订阅5小时使用限制
消息称马斯克要求特斯拉员工尽可能使用Grok
Opus 4.8到底是神作,还是一次仓促的公关手段?
华为余承东:问界M5交付超15万台,将于明年换代
Qwen3.7-Max获得56.6分,排名全球第五、国产第一。
联想moto首款大折叠手机!moto razr fold图赏
小米REDMI K90 Max手机跑分曝光:天玑9500芯片+16GB内存
本次测评中,PingAnGPT-Qwen3-32B在金融事实推理与计算、金融专业知识问答、金融合规与风险控制等多项关键指标表现卓越,展现出精准的金融数值计算能力、严谨的逻辑推理能力和全金融领域知识体系的深度掌…
方程豹豹5拿下澳洲5星安全评级 结果因太硬撞飞测试车反被扣8分
06/25 00:14
06/25 00:13
06/13 18:29
06/13 18:26
06/13 18:25
06/13 18:23
06/13 18:20
06/13 18:16