像真人、能干活、会带货……
论坛组织者、香港中文大学计算机科学与工程学系助理教授王历伟表示,AI研究重点正从大语言模型进一步转向多模态人工智能,让AI不仅能够处理文字,还能够理解真实世界,并最终部署到实际物理环境中。
1亿美元留不住
西北工业大学、香港科技大学和浙江大学的研究团队提出Remember-R1,试图从源头上修正这一偏置:不修改推理流程,而是在强化学习后训练中加入三种过程奖励,让模型不仅要答对,还必须在整条推理链中持续表达、保…
入选华为天才少年等顶尖人才计划
业务战略方面,梁汝波对此前“收缩业务宽度”作出解读,后续将优先发展“粗主线”,如抖音可带动电商、生活服务,豆包也可作为“粗主线”带动更多业务和生态。
都是出于商业考虑。
达摩院表示,此次课题设置旨在聚焦大模型训练推理、AI芯片架构、医疗AI及工业智能等关键领域,推动技术创新与产业落地。
做工具更多是在想办法把多模态模型的黑盒能力全部开发出来,让普通用户也能用到 100% 的能力。
模型能够结合画面、声音和时序信息理解用户意图,例如利用视觉信息消除同音词歧义、识别手势和指代对象,并持续跟踪画面变化,在目标出现时主动提醒用户。
Hy3是腾讯混元于7月6日正式发布的MoE架构大模型,整体参数规模295B,动态激活参数21B,最高支持256K超长上下文读取。
新海报的主题和内容已经完全改变,但画面构图、色彩、文字层级和复古颗粒质感都与参考图保持呼应。
对AI来说理解某一个画面或者总结一个视频内容确实不是难事儿
作为连接硬件算力与上层应用生态的核心枢纽,MXMACA 软件栈全链路覆盖底层驱动、用户态接口、MXCC 编译器、算子深度适配及主流训练 / 推理框架对接,原生兼容国际主流生态,适配 PyTorch、TensorFlow、vLLM 与 SGLang 等 40 余种主流 AI 框架,支持 500+ AI 模型稳定运行,大幅缩短传统模型适配周期。
IT之家 8 月 3 日消息,商汤科技今日宣布,面向社区开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。
行业竞争从单一的技术比拼,转向更开放的生态竞争。
凤凰网科技讯(作者/于雷)8月3日,阿里云千问团队正式发布Qwen 3.8-Max大模型,其参数规模达到2.4万亿(激活参数95B),主打编程、办公、科研及长程任务的端到端交付能力,并宣布将于下周开源权重。
它能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高2K分辨率、最长15秒、带有原生立体声音频的视频。
字节跳动Seedance 2.5模型亮相:30秒视频生成,多模态与编辑能力再升级
字节跳动Seedance 2.5发布:长叙事多模态编辑升级,赋能视频创作新体验
MiniMax H3 支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频,最高可支持 15s 2K 分辨率。
IT之家 7 月 31 日消息,稀宇科技今天宣布推出 MiniMax H3全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频,最高可支持 15s 2…
Thinking Machines发布反超初代的开源模型Inkling-Small。
06/25 00:14
06/25 00:13
06/13 18:29
06/13 18:26
06/13 18:25
06/13 18:23
06/13 18:20
06/13 18:16