最令人意外的是能效表现,Signal65指出,骁龙系统在平衡电池模式下的性能,竟然优于英特尔系统在最佳性能插电模式下的表现,这意味着用户在移动办公场景下,无需连接电源即可获得超过对手旗舰本的算力输出。
彭博社指出,中美数据差异并不意味着中国民众看不到 AI 风险,也不代表美国人更少使用 AI,两国公众的主要差别在于对 AI 收益能否惠及自身,以及对科技企业是否“听政府话”的看法不同。
通过更大规模、更长周期、更多样任务环境的后训练,GLM-5.3 进一步释放模型能力上限:编程能力较上一代提升 50%,并在多项公开基准测试中取得开源模型第一;
当一个编码和网安能力都排在前列的模型开放权重,人人都能下载时,它在挖漏洞上的天赋,就既是白帽子的工具,也可能变成另一群人的武器。
据公开的基准测试数据,该模型在Agentic terminal coding测试中得分73.0(Qwen3.6-27B为63.4),在SWE-bench Pro测试中得分61.7(Qwen3.6-27B为53.5),在专业工作任务测试JobBench中得分33.4,较Qwen3.6-27B的21.8提升约50%。
极氪确认,8月中下旬将在宁波国际赛车场举办“首期新能源飘移赛照培训”,前期在赛车改装、赛道包场及安全保障等方面的投入确实高达800万元。
智谱表示,在多项主流基准测试中 GLM-5.3 是当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。
全球三大顶流模型齐更新
新模型在 Grok 4.5 基础上进一步强化长时间运行的智能体任务,以及复杂的交互和视觉工作。
即使使用相同的 HW3 硬件,新版本软件也让车辆相比运行旧版软件的车型快了 36.6%。
西北工业大学、香港科技大学和浙江大学的研究团队提出Remember-R1,试图从源头上修正这一偏置:不修改推理流程,而是在强化学习后训练中加入三种过程奖励,让模型不仅要答对,还必须在整条推理链中持续表达、保…
8月8日消息,据彭博社报道,受人工智能相关股票暴跌的影响,中国量化对冲基金在7月份遭受了巨大损失,导致一些基金年内亏损,而另一些基金的表现也仅仅比基准股指略好一些。
不要为极致的便宜而欢呼,「稳定的平衡」才是行业发展的本质。
快科技8月7日消息,据报道,本田将一款全新整车平台的开发工作整体外包给印度塔塔技术公司(Tata Technologies),以大幅削减开发成本。
快科技8月6日消息,韩国敲定了明年的最低时薪标准,换算成人民币约为50.6元,本土半导体、AI相关行业的实际在岗薪资更是远高于这个通用基准线。
当DeepSeek跑完所有基准测试的时候,Claude才刚跑完一半
根据这一自愿性计划,参与其中的AI开发商可以在模型向其他可信合作伙伴开放之前,向政府提供最长30天的模型访问权限。
凤凰网科技讯 北京时间8月3日,据路透社报道,美国旧金山研究公司Artificial Analysis称,DeepSeek旗舰AI模型的一个版本,在全球知名模型基准测试中的运行成本是目前为止最低的,比Anthropic旗下Claude Fable 5的运行成本便宜逾100倍。
IT之家 8 月 3 日消息,商汤科技今日宣布,面向社区开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。
凤凰网科技讯(作者/于雷)8月3日,阿里云千问团队正式发布Qwen 3.8-Max大模型,其参数规模达到2.4万亿(激活参数95B),主打编程、办公、科研及长程任务的端到端交付能力,并宣布将于下周开源权重。
据介绍,国家超算互联网现面向企业和开发者开放该模型的API调用服务,无需进行繁琐的环境配置,即可快速接入使用,为各行业提供高性能、安全可靠且普惠的全场景AI开发支撑。
@arena (Arena.ai) 是当前全球 AI 行业最权威的“人类偏好”大模型即时对战与评测平台。
在未调整优化前,GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的得分为 7.8%,而 GPT-5.5 模型的得分只有 0.4%。
Thinking Machines发布反超初代的开源模型Inkling-Small。
性价比之王要打 Agent 仗了
AI写作的黄金时代,开始塌了。
马斯克旗下SpaceXAI最智能AI语音模型,Grok Voice Think Fast 2.0登场
美国越封锁中国AI越强!月之暗面被曝启动Kimi K4训练:规模比K3更大
被解雇的特斯拉FSD区域经理起诉前东家,直言Robotaxi是“移动的危险”
06/25 00:14
06/25 00:13
06/13 18:29
06/13 18:26
06/13 18:25
06/13 18:23
06/13 18:20
06/13 18:16