资讯
谷歌推出全新AI生图模型Nano Banana 2 Lite:4秒出图,主打高频批量内容生产
谷歌正式推出全新AI生图模型Nano Banana 2 Lite,仅需4秒即可生成高质量1K图像,生成成本低至0.034美元/张(约0.23元)。该模型专为高频迭代和批量内容生产场景设计,已全面登陆Google AI Studio、Gemini API及企业平台,并将完全替代旧版。同时推出的Omni Product Studio支持静态图像一键转为电影级电商视频,为开发者提供端到端多媒体创作解决方案。
Anthropic发布大模型Claude Sonnet 5:性能逼近旗舰,价格大幅下调
Anthropic推出全新大语言模型Claude Sonnet 5,性能逼近旗舰Opus系列,但价格大幅降低。该模型具备强大的自主代理能力,能规划复杂任务、调用外部工具,同时幻觉率和讨好式回应下降,安全性提升。目前已作为免费和Pro计划默认模型,旨在以低价策略让更多用户享受顶尖AI体验。
Claude Sonnet 5发布:AI主力模型进入高能低耗新时代
Anthropic发布新一代核心大模型Claude Sonnet 5,定位为日常高频工作流主力,性能逼近旗舰模型Opus 4.8,在编码、工具调用及逻辑规划方面表现出色,同时成本显著降低,API价格仅为Opus的60%。该模型全平台上线,支持1M Token上下文窗口,在安全性与稳定性上也有提升,为企业级AI应用提供高性价比解决方案。
Qwen 3.6 27B评测显示本地模型性能已达前沿水准,媲美GPT-5
本文评测了Qwen3.6 27B本地大模型的性能表现,显示其在智力水平上已接近或对标GPT-5、Claude Sonnet 4.5等顶级付费模型。在MacBook上实测达到稳定32tok/s速度,并能在复杂任务中高质量完成,如写诗和生成游戏。文章强调本地模型在成本、隐私和掌控感方面的优势,标志着消费级硬件运行的开源模型已迎来重要拐点,值得开发者和创作者关注。
让机器人先学动作语言:LA4VLA 重新拆解 VLA 预训练
本文深入探讨了标准VLA模型中语言指令容易被视觉信息主导的问题,并通过实验展示模型在冲突情境下更依赖视觉而非语言。文章介绍了LA4VLA方法,它通过先进行无视觉的语言-动作预训练,让模型学习语言与动作的基本对应规律,再结合视觉进行完整策略学习,从而提升机器人对语言指令的真正理解与执行能力。
美团开源万亿参数模型LongCat-2.0,算力界的巨无霸来了
美团正式开源万亿参数大模型LongCat-2.0,该模型在五万卡国产算力集群上完成训练,总参数1.6T,采用动态范围设计(激活参数约48B),预训练数据超30T tokens,原生支持1M超长上下文。这一举措不仅验证了国产软硬件在大规模分布式计算中的可靠性,也为行业提供了超大规模模型构建的参考范式,将推动开发者社区创新应用的发展。
小红书开源 RedKnot 推理引擎,长上下文处理效率翻倍,助力告别“长文本焦虑”
小红书技术团队开源RedKnot推理引擎,创新打破传统KV Cache按token维度存储模式,沿注意力头维度拆解并引入头分类稀疏、稀疏FFN、SegPagedAttention三大机制,实现长上下文推理效率大幅提升。实测TTFT加速1.6-3.54倍,并发提升4.7-7.8倍,FLOPs降低67%-79.5%,DeepSeek-V4-Flash在128K上下文下表现优异且精度保持95%以上。代码已开源,为高效AI推理提供新路径。
OMG多模态人形机器人运动生成框架发布:一句话或一段音乐即可操纵机器人完成全身动作
清华大学MARS实验室推出OMG多模态人形机器人运动生成框架,创新采用“生成大脑+跟踪小脑”分层控制架构。依托1174小时高质量OMG-Data数据集和OMG-DiT扩散模型,机器人仅需一句话、一段音乐或人体动作,即可实时自主生成稳定可执行的全身运动轨迹。该框架性能领先,支持零样本模态组合与泛化能力,已全面开源,为人形机器人通用智能控制提供完整解决方案。
从第一性原理看机器人AI:为什么它比大模型更难?
本文从第一性原理出发,将机器人控制问题简化为一个“观测输入→动作输出”的函数,清晰拆解物理AI的核心机制。文章对比大语言模型,重点分析机器人面临的独特挑战:除了数据与算力,还必须应对严格的实时性约束——物理世界不会等待模型思考。作者详细介绍现代VLA架构如何将大型VLM(负责世界理解的System 2)与小型快速动作专家(System 1)结合,以NVIDIA GR00T N1和Physical Intelligence π₀为例,揭示具身智能在延迟、泛化上的本质困难。为理解机器人AI发展路径提供了深刻洞
世界模型到底在建模什么
2025-2026年,具身智能领域最热却最混乱的概念是“世界模型”。本文系统拆解李飞飞提出的渲染器(Sora像素预测)、仿真器(V-JEPA抽象物理常识)、规划器(DreamZero动作状态联合预测)三条路线,揭示它们实际解决完全不同的问题。同时深入剖析数据三角困局(真实数据稀缺、sim-to-real差距、模型崩溃)、长时序预测误差累积的架构局限,以及参数规模并非关键(智元GE 2.0以20亿参数击败140亿参数模型)。为行业提供冷静务实的思考框架。
模型变小,能力不减:新浪VibeThinker-3B开源,AI推理迎来轻量化新思路
模型无需越大越强!新浪开源VibeThinker-3B仅以30亿参数,在数学推理、编程竞赛等高难度任务中展现出媲美甚至超越百倍规模大模型的性能。该模型基于Qwen2.5-Coder-3B,通过监督微调、强化学习、自蒸馏等多阶段后训练,将逻辑推理能力深度浓缩。研发团队提出“参数压缩-覆盖假说”,证明结构化任务可高效压缩进小模型。目前已在Hugging Face和GitHub开源,为AI推理轻量化提供全新低成本高性能范式。
不再只是会走路的双臂平台:OpenHLM解放人形机器人全身移动操作能力
清华大学交叉信息研究院推出开源项目OpenHLM,为人形机器人提供一套完整的VLA配方。该系统突破传统“会走路的双臂平台”局限,让机器人能像人类一样协调手、腰、腿、脚完成语言驱动的全身移动操作任务,包括下蹲取物、脚踩踏板、推车等。通过三阶段系统实验,确定了最优全身遥操作接口、多步flow动作生成方式及低成本HuMI等异构数据协同训练方法,在HLM-12基准上验证了其高效泛化能力,为具身智能提供实用开源方案。
百度开源3B模型Unlimited OCR:5天Star破万,刷新长文档解析纪录
百度开源3B参数Unlimited OCR模型,专为书籍、论文等长文档解析打造。上线5天GitHub Star破万,登顶多平台趋势榜。创新引入R-SWA机制,实现数十页文档一次性连续解析并保持KV Cache恒定规模,在OmniDocBench以93.92%刷新纪录,速度领先DeepSeek OCR,为海量文档数字化和大模型长上下文管理提供高效新路径。
马斯克宣布每月推出全新大模型 Grok 4.5 内测性能比肩 Claude Opus
埃隆·马斯克宣布,xAI Grok 4.5已在SpaceX与特斯拉启动Beta内测。该模型基于1.5万亿参数V9基础模型打造,并融入Cursor编程工具数据,早期性能已接近甚至超越Claude Opus。更具颠覆性的是,马斯克透露SpaceX将在2026年剩余时间内每月推出一个“完全从零开始训练”的全新基础模型,这一激进节奏远超行业常规。同时SpaceX拟600亿美元收购Cursor开发商Anysphere,彰显xAI深耕企业级AI与编码辅助赛道的战略决心。
北大与DeepSeek联合开源大模型推理框架DSpark,实现算力提速关键突破
北京大学与DeepSeek联合开源DSpark大模型推理加速框架。该框架针对高并发自回归生成中的响应延迟与算力浪费痛点,创新采用半自回归架构(2层Transformer优于5层并行模型)与置信度调度验证机制。在代码、数学、对话等多场景测试中显著优于Eagle3和DFlash,尤其擅长长序列生成。已落地DeepSeek-V4服务并全面开源代码、权重及工具,为行业提供低成本高性能推理技术范式。