李飞飞团队最新研究:告别昂贵“虚实转换”,一段视频即可生成无限机器人训练场

李飞飞团队最新研究:告别昂贵“虚实转换”,一段视频即可生成无限机器人训练场

李飞飞团队联合英伟达GEAR实验室、佐治亚理工大学等最新推出SimFoundry系统,提出Real2Sim革命性范式,仅需一段真实世界视频,即可自动构建高精度“数字孪生”并生成海量“数字表亲”变体,打造无限交互式机器人训练与评测仿真环境。该方法彻底解决传统Sim2Real成本高、迁移难的痛点,实验显示仿真评测与真实结果高度一致,训练策略可在多步操作、双臂协作等复杂任务中实现零样本迁移。这一开源研究大幅降低具身智能开发门槛,有望加速机器人从实验室走向真实世界的进程。

2026-07-06 10:51
196
0

海外研选|摩根大通:Token用量、GPU租赁和DRAM价格齐升,AI基建需求仍获支撑

海外研选|摩根大通:Token用量、GPU租赁和DRAM价格齐升,AI基建需求仍获支撑

摩根大通最新报告显示,6月LLM Token用量环比激增70%、同比20倍,支出同步加速。尽管模型价格下降,但使用量扩张更快,通过降低门槛推动AI推理需求增长。中国低成本模型快速抢占Token份额,美国高端模型仍主导85%以上高价值支出。同时非超大规模云厂商GPU租赁价格(A100、H100、B200)与DRAM现货价格持续上行,AI基建需求仍获强劲支撑。

2026-07-03 20:28
4
0

ATHENA将影响函数扩展到十亿参数VLA,实现313倍加速筛选高价值数据

ATHENA将影响函数扩展到十亿参数VLA,实现313倍加速筛选高价值数据

具身智能进入数据Scaling时代,如何量化机器人示教轨迹价值成为关键。上海交大、同济大学等团队提出ATHENA框架,将影响函数扩展至十亿参数多任务VLA模型。通过Kronecker梯度压缩、随机截断加速Hessian逆和MII多任务交互机制,实现313倍加速(8054.6→25.7 GPU小时),从因果视角评估数据对下游任务成功率的影响。实验显示,筛选高价值数据后,模型用更少样本反而性能更优,为机器人数据curation提供可扩展新范式。

2026-07-03 19:33
7
0

AI智能体Elements Claw成功实现超导材料研发闭环

AI智能体Elements Claw成功实现超导材料研发闭环

阿里达摩院发布全球首个超导材料AI智能体Elements Claw。该智能体基于10亿参数原子基础模型,实现文献查阅、实验设计到验证的全闭环自主研发。仅用28 GPU小时从240万晶体中筛选6.8万候选,并成功验证4种全新超导材料(最高Tc 6.5K)。这一里程碑标志AI从辅助工具走向独立科学发现,已开放240万晶体数据,未来可扩展至固态电池等领域。

2026-07-03 16:26
98
0

英伟达开源双塔AI模型,文本生成速度提升2.42倍,画质保留98.7%

英伟达开源双塔AI模型,文本生成速度提升2.42倍,画质保留98.7%

英伟达7月2日开源Nemotron-Labs-TwoTower双塔离散扩散语言模型。该60B参数模型采用创新双塔架构(上下文塔冻结+去噪塔并行扩散生成),突破传统LLM逐Token生成瓶颈,实现文本生成速度提升2.42倍,同时综合能力保留98.7%。基于Nemotron预训练权重改造,开发成本低,已在Hugging Face开放权重,支持商用部署。

2026-07-03 16:06
103
0

中国发布全球首个地层学AI大模型 地球46亿年历史首次拥有共享数据库

中国发布全球首个地层学AI大模型 地球46亿年历史首次拥有共享数据库

中国科学家发布全球首个地层学AI大模型及智能全球地层剖面对比系统,地球46亿年演化历史首次拥有全球共享数据库。这一成果将推动地层学研究从传统人工比对迈向AI智能与全球数据共享新时代,为生命起源、资源分布、气候演变等研究提供统一时间轴和强大工具。中国已发现11颗“金钉子”,数量稳居世界前列。

2026-07-03 15:56
3
0

Generalist 摒弃 VLA 与世界模型,开辟具身智能原生交互新路径

Generalist 摒弃 VLA 与世界模型,开辟具身智能原生交互新路径

硅谷具身智能独角兽Generalist跳出VLA与世界模型固化赛道,打造原生物理交互新路径。由DeepMind与波士顿动力核心团队创立,通过自研穿戴式采集设备积累50万小时真实人类交互数据,从零训练以力学反馈为核心的GEN模型,专注灵巧操作,验证物理AI缩放定律(成功率66%→99%),为具身智能商业落地提供第三条差异化路线。

2026-07-03 15:21
10
0

阿里开源Page Agent让大模型理解网页底层逻辑

阿里开源Page Agent让大模型理解网页底层逻辑

阿里巴巴开源Page Agent是一款创新JavaScript客户端库,通过“DOM脱水”技术将复杂DOM树压缩为轻量FlatDomTree纯文本映射,让大模型无需截图或多模态分析即可直接读懂网页底层逻辑。该方案内嵌运行、天然继承Cookie与登录态,兼容任意LLM,适用于SaaS智能副驾、自动化数据采集和Web无障碍交互等场景。已在GitHub以MIT协议开源,帮助开发者以低成本实现高效网页自动化,告别代码重构焦虑。

2026-07-03 11:06
42
0

阿里开源 Page Agent:大模型读懂 DOM,网页控制新范式

阿里开源 Page Agent:大模型读懂 DOM,网页控制新范式

阿里巴巴开源Page Agent,通过“DOM脱水”技术将网页实时DOM结构压缩为轻量FlatDomTree纯文本,让大语言模型无需视觉或多模态输入即可精准操作页面。该JS客户端库直接嵌入网页运行,可无缝继承用户Cookie和会话,支持任意OpenAI兼容模型。适用于AI副驾、自动化表单、无障碍交互等场景,极大降低成本,已在GitHub以MIT协议开源。

2026-07-03 10:31
60
0

Meta不向供应链低头,联手台积电美光让新服务器用上旧内存

Meta不向供应链低头,联手台积电美光让新服务器用上旧内存

Meta不向供应链低头!在DDR5内存严重断货的AI时代,Meta联合台积电与美光成功研发“缝合怪”兼容技术,让新一代AI服务器能够稳定运行旧款DDR4内存。该方案通过特殊插槽转换垫片克服代际物理与协议差异,虽然带宽下降约30%,但延迟表现优异且稳定性高。这一创新帮助Meta快速激活闲置服务器,绕过漫长等待期,打破芯片巨头硬件迭代周期,为全球数据中心行业应对供应链危机提供了极具启发性的自救范本。

2026-07-03 10:31
3
0

地瓜机器人推出世界模型Uranus:逐帧预测与反馈,探索机器人生成式仿真

地瓜机器人推出世界模型Uranus:逐帧预测与反馈,探索机器人生成式仿真

地瓜机器人推出Uranus世界模型,这是一个基于视频扩散的帧级闭环交互式世界模型。它根据参考图像、机器人关节状态、相机参数和文本描述自回归生成多相机连续视频,支持实时动作反馈与调整。通过统一骨架渲染适配G1、Franka等多种机器人,并采用因果注意力、Frame-Relative RoPE和Reference Sink实现长时稳定闭环(训练2s生成60s),保持多视角一致性。将机器人仿真从手工3D建模升级为数据驱动生成式范式,为具身智能提供高效视觉数字孪生平台。

2026-07-02 19:39
20
0

4亿参数“小脑”开源:HoloMotion-1 弥补人形机器人短板

4亿参数“小脑”开源:HoloMotion-1 弥补人形机器人短板

地平线开源HoloMotion-1,这是一个4亿参数的人形机器人“小脑”基础模型。文章解析了其与传统控制方法的差异,重点介绍了MoE Transformer架构如何通过稀疏激活和KV-cache实现端侧200-300Hz高速推理,支持零样本迁移,填补了人形机器人底层运动控制、动态平衡与全身协调的短板,为具身智能从规划到稳定执行提供关键开源基础设施。

2026-07-02 18:10
2
0

AReaL2.0开源,打造面向自演进智能体的RL基础设施

AReaL2.0开源,打造面向自演进智能体的RL基础设施

AReaL2.0正式开源!该项目为真实业务中的Agent提供在线强化学习(Online RL)基础设施,让智能体在完成任务时产生的交互、决策与反馈能安全转化为持续学习数据,实现“越用越强”的自演进能力。无需重构Agent,只需通过统一推理入口即可接入训练闭环,并内置企业级数据代理机制保障安全合规。由蚂蚁集团、清华、港科大发起,现独立开源并加入PyTorch Foundation。

2026-07-02 16:29
82
0

2026年了,我们还在用爱迪生试灯丝的方式评估世界模型

2026年了,我们还在用爱迪生试灯丝的方式评估世界模型

2026年了,我们还在用爱迪生试灯丝的方式评估World Model?Sora热潮退去后,World Model成为学术界、工业界与投资人共同关注的AI下一战场。本文提炼自五源信号站5Hz第二期活动,严肃界定了action-conditioned World Model的核心内涵,剖析生成派、JEPA派、空间智能派三种不同技术路线,指出它们通往的并非同一个AGI。其本质是一个“想象力引擎”,能让Agent在行动前对世界进行多步推理与概率性预测。文章认为,World Model的终局或将是一场关于“世界压缩

2026-07-01 17:46
2
0

英伟达发布Nemotron-Labs-TwoTower扩散语言模型 性能提升超两倍

英伟达发布Nemotron-Labs-TwoTower扩散语言模型 性能提升超两倍

英伟达正式开源Nemotron-Labs-TwoTower扩散语言模型,采用创新双塔架构(冻结上下文塔+去噪器塔),在保持98.7%生成质量的前提下,实现生成吞吐量2.42倍提升。该模型支持扩散、模拟AR和标准AR三种解码模式,完全开源支持商业用途,为大规模文本合成与大模型推理加速提供高效新方案。

2026-07-01 17:45
149
0