资讯
德国研究联盟发布开源大模型Soofi S,推动AI主权实现新突破
文章聚焦德国研究联盟发布的开源大模型Soofi S,介绍其基于混合专家架构的高效设计、德语强化训练策略、长上下文与代码生成等优势表现,以及其在欧洲主权AI基础设施和工业应用落地中的重要意义。
腾讯混元发布 HyOCR-1.5:仅 1B 参数,推理速度提升 6.37 倍
腾讯混元发布全栈开源端到端OCR模型HyOCR-1.5,以仅1B参数实现高性能文档识别,并借助DFlash投机解码将推理速度最高提升6.37倍。文章重点介绍其开源价值、训练创新及在复杂文档、古文字和图表解析等场景中的越级表现。
世界模型应如何评估?南京大学团队发布「世界模型」评估立场论文
文章介绍南京大学团队关于“世界模型”评估的立场论文,指出面向具身智能与机器人决策的世界模型,应重点考察其对行动后果预测、策略评估与规划优化支持能力,并提出从L0到L7的评估阶梯,帮助厘清不同能力主张与证据强度。
蚂蚁集团连发两款开源安全模型,为大模型与智能体套上安全“紧箍咒”
文章介绍蚂蚁集团开源两款AI安全模型SingGuard-NSFA与SingGuard,分别聚焦智能体行为安全和多模态内容安全,解决提示词注入、权限滥用、数据泄露等风险,展示其在实时拦截、规则更新和公开评测中的领先能力,体现蚂蚁在AI安全治理上的系统化布局。
商汤开源SenseNova-Vision统一视觉大模型,可单模型覆盖四大核心视觉任务
文章介绍了商汤全面开源SenseNova-Vision统一视觉大模型,强调其以单模型覆盖目标检测、分割、深度估计和多视角3D重建四大核心视觉任务,并在多项权威评测中领先同类通用模型及部分专家模型,同时同步开源5000万条视觉指令数据集。
机器人不能永远“借脑”:具身原生正成为行业新分水岭
机器人无法永远“借脑”于通用大模型。具身智能正面临关键范式转折:它究竟是大模型能力向物理世界的外溢,还是需要生长出真正属于机器人的原生智能范式?本文深入剖析数字世界模型与物理世界在时间尺度、因果关系、错误成本等方面的根本错配,指出当前“取巧”式迁移的局限。行业先锋提出“具身原生”路线,主张围绕动作、接触、状态变化重构数据、训练目标、架构与评测体系。LingBot-VA 2.0的发布标志着这一转变的开始,或将成为具身智能赛道新的行业分水岭。
机器人不能永远“借脑”:具身原生正成为行业新分水岭
机器人无法永远“借脑”于通用大模型。具身智能正面临关键范式转折:它究竟是大模型能力向物理世界的外溢,还是需要生长出真正属于机器人的原生智能范式?本文深入剖析数字世界模型与物理世界在时间尺度、因果关系、错误成本等方面的根本错配,指出当前“取巧”式迁移的局限。行业先锋提出“具身原生”路线,主张围绕动作、接触、状态变化重构数据、训练目标、架构与评测体系。LingBot-VA 2.0的发布标志着这一转变的开始,或将成为具身智能赛道新的行业分水岭。
蚂蚁灵波发布具身原生世界动作模型LingBot-VA 2.0,支持从零开始预训练
蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA2.0,该模型基于自回归架构从零开始预训练,采用语义视觉-动作分词器、因果预训练范式、MoE架构及增强异步推理等核心设计,实现了单卡150Hz实时推理效率,具备出色的执行速度和泛化能力。标志着机器人基础模型从数字世界模型转向物理世界原生设计,代表了具身智能发展的关键路线选择。
谷歌升级 Android Bench 代码排行榜:Claude 5 登顶榜首,Gemini 在准确率和效率上均落后
谷歌升级Android Bench代码排行榜,引入Harbor沙箱框架并开源,推动AI代码评估标准化。在最新排名中,Anthropic的Claude Fable5以84.5%准确率夺冠,OpenAI GPT-5.5紧随其后,而谷歌Gemini 3.1 Pro仅列第五,暴露出准确率与效率的双重短板。尽管Gemini在成本上略有优势,但轻量级模型效率严重不足。此次改版突显了行业向自主智能开发转型的趋势,Android Bench正成为权威的AI代码评估平台。
OpenAI推出GPT-Live语音模型,支持同时聆听和说话,打造“真人感”对话
OpenAI正式推出新一代语音模型GPT-Live,旨在打造更具“真人感”的对话体验。该模型最大亮点是支持同时聆听和说话(全双工交互),能自然使用“嗯哼”等反馈短语表明正在倾听,支持耐心等待、背景噪音过滤,并基于GPT-5.5提供实时翻译、深度推理、网络搜索等强大功能。GPT-Live将取代现有ChatGPT语音体验,从即日起向全球用户推出GPT-Live-1(付费用户默认)和GPT-Live-1 mini(免费用户默认)两个版本,让人机语音交流更加智能自然。
具身智能测试难度堪比“高考”:人类得分100分,最强模型仅12.8分
文章围绕RoboDojo这一具身智能新基准展开,解析其如何通过42个仿真任务、18个真实世界任务和五大核心能力维度,系统评测机器人基础模型的真实水平。结果显示当前最强模型与人类表现差距巨大,揭示通用操作机器人距离落地仍有明显鸿沟。
Mistral发布8B模型Robostral Navigate:仅用单个普通摄像头即可自主导航,性能优于多摄像头方案
Mistral发布8B参数Robostral Navigate模型,机器人仅用单个普通RGB摄像头即可实现复杂环境自主导航。在R2R-CE测试中全新场景成功率76.6%,性能碾压多摄像头和深度传感器方案。该模型纯模拟训练,支持轮式、腿式和飞行机器人,大幅降低硬件门槛。
6万小时真实物理数据训练,蚂蚁灵波具身基座模型 LingBot-VLA 2.0 开源
蚂蚁灵波科技开源LingBot-VLA 2.0具身基座模型。该模型预训练融入6万小时高质量真实物理数据,覆盖17个主流机器人品牌、20种构型,全面支持头部、腰部、末端执行器及移动底盘自由度。在GM-100双臂操作评测和长程移动操作任务中以单一通用模型领先π0.5与GR00T N1.7,展现强大跨本体泛化能力。同时开源高效后训练版本(RTX 4090推理<130ms),已在零售、物流、工业场景启动商业落地测试。
OpenAI语音助手升级:GPT-Live全双工模型上线,ChatGPT实现边听边说
OpenAI正式发布GPT-Live全双工语音模型,ChatGPT语音体验迎来重大升级!新架构突破传统“说-听”排队模式,实现真正边听边说、同时思考,能自然插入“嗯哼”反馈、灵活处理打断,并在语音中调用GPT-5.5进行复杂推理与任务规划。GPT-Live-1和mini版本覆盖免费用户至企业API,让语音助手进化成接近真人的智能对话伙伴。
蚂蚁灵波开源 LingBot-Video,发布全球首个面向具身智能的视频基础模型
蚂蚁灵波开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的开源视频生成基础模型。该模型在RBench基准上以0.620总分超越Wan2.6等,通过DiT+MoE(30B仅激活3B,3倍效率)、7万小时具身数据及物理合理性与任务完成度强化学习,在物理规律、动作一致性和任务执行上实现突破,为机器人动作预测、仿真数据生成、世界模型研究提供全新开源底座。