谷歌 DeepMind 发布 GenCeption,旨在打破专用模型桎梏并处理五大视觉任务

谷歌 DeepMind 发布 GenCeption,旨在打破专用模型桎梏并处理五大视觉任务

本文介绍谷歌 DeepMind 发布的 GenCeption 模型,如何以单一生成式视觉模型同时完成深度估计、图像分割、3D姿态估计等五大任务,并凭借少量合成数据实现对真实多人、动物和机器人的强泛化与高效率处理。

2026-07-21 17:51
498
0

WAIC世界模型六小龙都在谈物理AI,我更关心一个问题:世界模型的预测究竟如何转化为机器人动作?

WAIC世界模型六小龙都在谈物理AI,我更关心一个问题:世界模型的预测究竟如何转化为机器人动作?

文章围绕WAIC论坛上“世界模型如何真正驱动机器人动作”这一核心问题,解析Kairos通过控制充分状态、视频与动作联合训练、多阶段数据课程及力触觉采集方案,把对未来的预测逐步转化为可执行机器人控制的技术路径与挑战。

2026-07-21 17:20
3
0

Anthropic Fable 5训练成本为开源模型三倍,未来面临挑战

Anthropic Fable 5训练成本为开源模型三倍,未来面临挑战

文章分析了 Anthropic Fable 5 在与 Kimi K3、Qwen 3.8 等模型竞争中面临的成本压力,指出其推理成本约为 OpenAI 和开源模型的三倍,并强调数据中心、算力与基础设施将决定 AI 公司未来的商业模式和市场竞争力。

2026-07-21 16:51
3
0

小鹏发布TuringViT视觉编码器:仅用十分之一数据,性能超越SOTA基线

小鹏发布TuringViT视觉编码器:仅用十分之一数据,性能超越SOTA基线

文章介绍了小鹏发布的TuringViT高效视觉编码器,重点解析其在线性注意力架构、数据治理流水线和动态分辨率训练上的创新。该模型仅用约十分之一训练数据,便在多项零样本分类与图文检索任务中超越主流SOTA基线,并面向智能驾驶、智能座舱和人形机器人落地。

2026-07-21 15:51
819
0

110亿参数塞进六类科学大脑:上智院开放“神珍”多模态模型,从蛋白质到气象场一个模型全读懂

110亿参数塞进六类科学大脑:上智院开放“神珍”多模态模型,从蛋白质到气象场一个模型全读懂

文章介绍上海科学智能研究院开放的多模态科学基础模型“神珍”,其以约110亿参数统一处理DNA、RNA、蛋白质、小分子、气象场和医学影像六类数据,并在理解、生成与分割等任务中取得有竞争力表现,同时开放权重、代码与文档,便于科研复用与共建。

2026-07-21 12:06
3
0

千问发布语音合成大模型Qwen-Audio-3.0-TTS:支持自然语言直接控制,实时版首包延迟降至300毫秒

千问发布语音合成大模型Qwen-Audio-3.0-TTS:支持自然语言直接控制,实时版首包延迟降至300毫秒

文章介绍千问发布语音合成大模型Qwen-Audio-3.0-TTS,主打用自然语言直接控制语气、节奏与风格,降低语音生成门槛。同时推出实时交互的Flash版和高音质的Plus版,分别覆盖语音助手、实时问答及有声书、配音等场景。

2026-07-21 11:28
1
0

谷歌研发“Frozen v2”专用芯片,将 Gemini 集成进硅片,单位功耗 Token 处理能力提升 6 到 10 倍

谷歌研发“Frozen v2”专用芯片,将 Gemini 集成进硅片,单位功耗 Token 处理能力提升 6 到 10 倍

文章聚焦谷歌研发代号“Frozen v2”的AI专用服务器芯片,计划将Gemini部分架构固化进硅片,以减少计算和数据传输开销,实现单位功耗下Token处理能力提升6到10倍。文中还分析了其背后的算力压力、灵活性代价及对谷歌AI战略的意义。

2026-07-21 10:42
3
0

通义千问Qwen-Audio-3.0-TTS正式开放:首包延迟300ms 支持20种方言

通义千问Qwen-Audio-3.0-TTS正式开放:首包延迟300ms 支持20种方言

阿里通义千问发布Qwen-Audio-3.0-TTS,首包延迟仅300ms,支持Flash和Plus双版本。Plus版在Artificial Analysis Speech Arena全球第一,平均说话人相似度82.75;Plus版覆盖16种语言及20种中文方言,通过自然语言指令实现细粒度语音控制,支持高噪声鲁棒性与48K高清音频。已全面开放,助力实时语音交互与内容创作。

2026-07-20 17:28
934
0

Kairos 3.1 发布定义具身世界模型新范式,原生统一架构打通底层技术壁垒

Kairos 3.1 发布定义具身世界模型新范式,原生统一架构打通底层技术壁垒

大晓机器人正式发布Kairos 3.1原生行动一体化开悟世界模型,通过原生统一架构打通理解、生成、预测技术壁垒,构建“理解-推演-执行-反思”全链路自进化智能闭环。该模型融合生成智能、物理智能与认知智能,基于第一性原理实现高密度信息提炼与行动代价最小化,为具身智能从实验室走向家庭、工业等真实场景提供完整落地路径,标志物理AI进入开悟时刻。

2026-07-20 16:12
3
0

阿里云百炼上线HappyOyster 1.0 支持实时交互的开放世界模型开启灰测

阿里云百炼上线HappyOyster 1.0 支持实时交互的开放世界模型开启灰测

阿里云百炼正式上线HappyOyster1.0开放世界模型,支持实时构建、探索与交互的数字世界。模型通过海量视频训练,学习世界状态转移规律,提供世界探索与实时导演两大模式,用户可输入文字或图片生成互动场景,支持1分钟连续位移与3分钟+高清视频生成,已开放Android、iOS、Web三端SDK并启动灰测。

2026-07-20 11:56
4
0

Google DeepMind发布GenCeption:基于视频生成模型实现多项计算机视觉突破

Google DeepMind发布GenCeption:基于视频生成模型实现多项计算机视觉突破

Google DeepMind发布GenCeption,基于预训练视频生成模型Wan2.1实现深度估计、图像分割、3D姿态估计等经典计算机视觉任务,在多项基准测试中接近或超过当前领先水平。模型仅需简化的架构即可通过一次前向传播完成任务预测,训练数据规模远低于传统专用视觉模型,展现出强大泛化能力与多任务潜力。

2026-07-20 10:47
1685
0

美团LongCat推出的LoHoSearch被刷至90%后,前沿模型整体跌回三成出头

美团LongCat推出的LoHoSearch被刷至90%后,前沿模型整体跌回三成出头

美团LongCat推出的LoHoSearch基准测试通过自动生成的762万实体维基百科知识图谱出题,将搜索智能体性能从BrowseComp的90%集体拉回34.74%,暴露出搜索agent的真实短板。544道问题覆盖11领域,已开源,为下一代搜索技术提供硬核试金石。

2026-07-20 10:45
4
0

阿里新一代大模型千问3.8将至,预览版已上线阿里云Token Plan、Qoder及QoderWork,用户可提前体验,正式版拟近期推出并开源。

阿里新一代大模型千问3.8将至,预览版已上线阿里云Token Plan、Qoder及QoderWork,用户可提前体验,正式版拟近期推出并开源。

阿里新一代大模型通义千问3.8即将正式发布并开源。Qwen3.8-Max预览版已上线阿里云、Qoder与QoderWork,用户可立即体验其能力边界。阿里采用预览先行、正式版紧随开源策略,提前释放信号并让模型在真实场景中验证。国产大模型开源节奏加速,新一代模型或重新界定开源天花板。

2026-07-20 10:26
54
0

面壁智能开源MiniCPM-Robot:1.5B参数VLA模型完整发布 个人开发者可在真实机器人上运行操作

面壁智能开源MiniCPM-Robot:1.5B参数VLA模型完整发布 个人开发者可在真实机器人上运行操作

7月19日,面壁智能开源MiniCPM-Robot系列首个1.5B VLA模型,让个人开发者在真实机器人上直接运行操作与目标跟踪。从此具身智能不再是实验室专属,模型权重和代码已完全开放,效率与实用性大幅提升,推动AI机器人应用走向大众。

2026-07-20 10:26
641
0

神珍科学多模态基础模型在沪亮相:110亿参数打通六类科学数据,一个模型读懂DNA到气象场

神珍科学多模态基础模型在沪亮相:110亿参数打通六类科学数据,一个模型读懂DNA到气象场

上海科学智能研究院在2026世界人工智能大会上发布神珍科学多模态基础模型(110亿参数),首个统一模型支持DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据跨领域融合理解与生成。模型开源开放,兼容Qwen3-VL-8B主干与1500+科学工具,标志着AI原生时代科学发现从方法论重构的里程碑,推动多学科协同创新。

2026-07-20 10:24
2
0