资讯
中国团队用“会动的眼睛”破解VLA空间视觉难题:相机仅挪动几毫米,成功率就会暴跌一半
VLA模型对相机视角变化极度敏感,挪动几毫米成功率暴跌。中国狮子山人工智能实验室诊断出‘捷径学习’和三种隐性耦合,提出‘运动之眼’范式,让相机动态采集数据,使陌生视角成功率从43%提升至83%,性能提升26.8%,兼容主流VLA架构,论文IROS 2026收录。
英特尔公布AI内存新专利:采用定制化封装方案或替代HBM4
英特尔公布XBM超高带宽内存专利技术,旨在替代HBM4,为AI提供更高带宽和更低成本。该专利重点革新芯片底层架构,将存储单元转移至BEOL后段制程,并采用定制化MoP反向悬垂封装方案,降低体积和成本,预计2030年后商业化。同时并行开发ZAM方案。
具身智能空间视觉死穴被最新顶会彻底解决
VLA模型在机器人操作领域展现强大能力,但对相机视角变化极其脆弱,成功率可从90%暴跌至30%以下。狮子山人工智能实验室团队诊断出相机-基座、相机-物体、物体-位置三种隐性耦合导致的捷径学习问题,并提出以“运动之眼”移动视角为核心的混合动态数据采集策略,彻底打破虚假相关性,让模型真正学会空间几何关系。该论文已被IROS 2026接收,为具身智能从实验室走向真实世界提供关键突破。
英伟达发布统一音频智能模型 Nemotron-Labs-Audex-30B-A3B
英伟达推出Nemotron-Labs-Audex-30B-A3B(简称Audex)统一音频-文本大语言模型。该模型基于MoE架构,通过单一Transformer解码器实现文本与量化音频token的统一处理,成功解决音频增强常牺牲文本能力的难题。在音频理解、语音识别、翻译和生成等任务上达到领先水平的同时,几乎完美保留了原LLM的推理、对齐、知识和长文本能力。作为开源成熟方案,为多模态AI开发者提供平衡性能的新选择。
蚂蚁集团周俊:万亿参数模型从“追求数量”迈向“深耕密度”
蚂蚁集团副总裁周俊在AICon大会上分享万亿参数模型效率优化。从“追求数量”迈向“深耕密度”,采用7:1 Lightning Attention+1 MLA混合架构、Kpop算法、思维链剪枝等技术,实现Token输出减少4倍、算力成本降低超10倍,千亿参数模型在Agent任务上超越更大模型,为智能体时代提供新参考。
中国大模型在美悄然崛起 企业发现极致性价比更诱人
中国AI大模型正在美国悄然崛起!DeepSeek、智谱GLM等中国开源模型在性能接近OpenAI和Anthropic前沿水平的同时,成本仅为其1/10至1/3,展现极致性价比。OpenRouter数据显示美国企业使用比例从4.5%飙升至30%以上,Lindy公司全面切换后每年节省数百万美元,Vercel平台采用量暴增。这一“价格才是关键”的趋势,正重塑美国企业AI采用策略。
气象预警再升级:“妈祖”大模型已覆盖全球40余国
在2026世界人工智能大会上,我国“妈祖(MAZU)”气象预警大模型取得重大突破,已成功落地包括共建“一带一路”国家在内的全球40多个国家。该模型依托深度学习与海量气象数据训练,能够实现复杂天气的实时监测与精准预警,为各国防范洪涝、台风等极端灾害提供强大技术支撑。这一成果不仅展现了中国AI底层技术的硬实力,更体现了中国在全球气象治理、气候变化应对和减灾防灾领域的重要贡献与责任担当。
蚂蚁集团开源Avernet:为多智能体协作提供新基础设施
蚂蚁集团旗下inclusionAI团队开源了多智能体协作基础设施Avernet V0.1。该项目专注于“协作层”建设,标准化了多Agent的注册、发现、邀请、共识达成和可追踪执行流程,支持自由聊天、领导-跟随等多种协作模式,并引入反馈闭环机制实现自动进化。Avernet兼容OpenClaw及各类异构Agent、bot平台,提供Docker部署方式,显著降低了多智能体应用开发门槛,有望成为行业重要的开源基础设施。
蚂蚁灵波LingBot-Depth 2.0空间感知模型正式发布 机器人视觉实现新突破
蚂蚁灵波科技正式发布LingBot-Depth 2.0空间感知模型。该模型基于1.5亿规模数据训练,在16项深度补全基准中获12项第一,大面积缺失场景误差减半,尤其在透明、镜面等复杂场景表现突出。同时推出业内首个以“边界结构”为预训练目标的LingBot-Vision视觉基座模型(开源ViT-G/L/B/S四版本),性能超越DINOv3。该成果已通过奥比中光认证,并展开深度合作,助力机器人突破“看准、看稳”瓶颈,加速具身智能落地。
开源OfficeCLI让AI智能体自主驾驭文档
本文介绍了一款名为OfficeCLI的开源工具,它是全球首款专为AI智能体定制的Office套件。通过内置高保真HTML渲染引擎,OfficeCLI让AI能够像人类一样直观理解文档版式与结构,实现“渲染—观察—修正”的视觉闭环。该工具轻量级、无需第三方依赖,支持CLI和自然语言操作,可无缝接入Claude Code、Cursor等主流AI编程环境,显著降低AI处理文档时的错误率,为企业自动化办公和AI智能体能力释放提供了强大技术支撑。
降低数学科研门槛:Mistral AI 发布开源模型 Leanstral 1.5
Mistral AI 发布开源模型 Leanstral 1.5,专为数学形式化证明语言 Lean4 设计。该模型以119B参数和6B激活参数实现高性能与低成本,在 miniF2F、PutnamBench 和 FATE 等基准测试中取得创纪录成果,平均求解成本仅4美元,远低于同类模型。此外,它还能识别代码库中的真实漏洞,助力科研人员高效突破数学证明瓶颈。
Mistral AI开源119B参数数学证明模型:仅激活6B参数,解题成本仅为竞品1%
Mistral AI推出专为Lean4打造的开源数学证明模型Leanstral 1.5,总参数119B但推理时仅激活6B参数,以极低计算成本实现突破性性能。在miniF2F基准达成100%完成率,PutnamBench解决587道问题,成本仅为竞品约1%,同时在实际代码库中发现多个未知缺陷。该模型证明高效激活技术比单纯扩大参数规模更具实用价值,为数学形式化证明和软件验证的大规模应用扫清了经济与技术障碍。
两张图换个顺序,VLM就不会了:EgoTSR让机器人判断任务是否真的在推进
当两张图像调换顺序后,许多VLM准确率从99%暴跌至2%,暴露了严重的时间顺序偏差(chronological bias)。浙江大学等团队提出EgoTSR框架,从第一人称机器人视角构建4600万样本数据集,采用三阶段课程学习(CoT解释→Tag内化→LongTag长程规划),并引入Subtask Planner将高层任务分解为原子子任务。让VLM真正学会判断任务状态进展而非依赖时间先后,推动具身智能从感知进化到可靠规划。
通义千问升级,实时语音识别模型 Fun-ASR-Realtime 正式发布
通义千问正式发布实时语音识别模型Fun-ASR-Realtime。该模型首字识别延迟低至百毫秒级别,准确率逼近行业领先离线模型,支持30种语言及16种中文方言,为语音助手、会议速记等场景提供强大支撑,让AI语音交互更加自然流畅。
告别高额Token账单,pxpipe如何用“图像”重塑Claude Code开发成本
本文介绍了一款名为pxpipe的本地代理工具,通过将冗长的上下文信息转化为PNG图像,绕过文本Token的高额计费,帮助开发者在使用Claude Code时降低约60%-70%的API调用成本。文章详细阐述了其工作原理、有损压缩的局限以及智能门控机制,并通过SWE-bench测试验证了其在保持解决率的同时显著优化成本的能力。对于追求经济高效AI编程的开发者,pxpipe提供了一种极具价值的本地化解决方案。