智东西8月27日报道,今天,谷歌推出了Gemini 2.5 Flash Image,这款模型是谷歌最先进的图像生成和编辑模型。在电商等场景中,这一能力满足了企业用户对精确控制的需求;而在娱乐场景里,这一能力…
在根据文字进行图像修改时的准确率更高
智东西8月15日消息,今日晚间,阿里宣布推出首个开源多模态深度研究智能体(Deep Research Agent)——WebWatcher。WebWatcher的核心创新点在于配备了增强的视觉语言推理能力,…
据知情人士透露,此次收购旨在增强 meta 在人工智能音频技术方面的实力,特别是开发能够理解并模仿人类情感的下一代语音交互系统。 Conneau认为,虽然 OpenAI、Google 和 meta 等公司都…
在GPT-5发布后,OpenAI曾停止提供GPT-4o,这一决定曾引发用户争议。
GPT-4o模型在理解用户提示和还原文字内容方面表现更为出色
在Video-TT出现之前,视频理解领域已有相应的评测标准,但这些标准普遍存在一定局限性,导致AI的真实能力无法被准确衡量。在这种情况下,一些顶尖模型的表现接近甚至达到了人类水平(上图左侧),这容易给人一种…
06/25 00:14
06/25 00:13
06/13 18:29
06/13 18:26
06/13 18:25
06/13 18:23
06/13 18:20
06/13 18:16