阿里千问开源Qwen-Drive-1.0-4B:自动驾驶视觉语言模型新突破
与主打空间计算和沉浸式AR体验的Vision Pro不同,这款全新眼镜定位为轻量化AI穿戴设备,将视觉智能技术深度融入Siri,旨在革新用户与现实世界的交互方式。其核心交互依赖摄像头、麦克风和扬声器,使Si…
在非全面屏时期,怎么让屏幕在视觉上更有震撼力,十几年前就已经是手机设计的一大课题了。
在2026中国国际大数据产业博览会展馆内,贵州省天地伟业数码科技有限公司带来多款AI创新成果集中亮相,展示人工智能技术赋能城市治理、公共安全、企业管理等领域的实践成果。 本届数博会,天地伟业聚焦“AI赋能行…
Aghajanyan和Shrivastava认为,他们的工具与现有模型的不同之处在于其通用性——它并非为某一特定的重复性任务而构建,而是能够根据所处的具体环境或情境灵活适应。A:Isaac 0.5是Per…
这次更新重点上线两大实用新功能,同时优化视觉界面、修复已知bug,日常打字、办公文字处理效率大幅提升。
新版系统聚焦系统材质全面升级,在保持最大化通透感的基础上,优化了信息的清晰可读性,降低非必要的视觉干扰,全局材质应用也更加统一。
该论文提出了一套视觉驱动的反应式足球技能学习框架,让人形机器人仅依靠机载视觉,在动态环境中连续完成找球、追球、调整步态和多方向射门。
多模态这事上,梁文锋还是梁文锋,但他学会了放低姿态。
等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。
DeepSeek多模态视觉理解模型上线,API开放助力开发者解锁新场景
据官方介绍,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 来访问 V4-Flash-Vision-Exp 模型的 API。
据介绍,模型重点围绕真实视觉任务重新完善训练数据、任务设计与后训练流程,强化视觉质量、复杂指令遵循、文字与布局、原生4K、原生图像编辑和精细视觉控制等,提供更高可控性、更高清、更高性价比的能力工具,推动AI视觉生成真正跨越到“稳定完成真实视觉交付”的新阶段。
相比预览版,正式版重点围绕真实视觉任务优化训练数据与后训练流程,强化了复杂指令遵循、原生图像编辑、文字布局与原生4K输出等能力,旨在让AI视觉生成从“能看”走向“稳定完成真实视觉交付”。
为什么我们还需要MiniMax Design
“传统视觉感知链路中,光信号需经过图像传感器采集、模数转换、缓存搬运、数字分块与嵌入等多道工序,才能生成模型可处理的词元,海量冗余数据的频繁搬运导致边缘端能耗居高不下。” 缪峰表示,这一成果从根本上颠覆了“…
这款移动机器人由激光雷达导航底盘、六轴协作机械臂、深度视觉相机、无针注射模块共同组成,依靠AI视觉算法识别猪只体态,优先捕捉猪进食的状态。
在该模型加持下,宇树人形机器人实现了手 — 眼 — 脚协同,可右脚控制油门,并在驶出弯道前快速转向,将视觉时机、精准油门控制与驾驶语义结合起来。
像真人、能干活、会带货……
AirPods上的摄像头将把信息输入“视觉智能”,而Siri将能够回答佩戴者关于周围环境的问题,并记录信息。
06/25 00:14
06/25 00:13
06/13 18:29
06/13 18:26
06/13 18:25
06/13 18:23
06/13 18:20
06/13 18:16