Google DeepMind推出Lyria 3.5音乐生成模型,支持灵动声纹与情感释放

Google DeepMind推出Lyria 3.5音乐生成模型,支持灵动声纹与情感释放

Google DeepMind 推出 Lyria 3.5 音乐生成模型,在 Google Flow Music 平台正式亮相。模型在音乐性、歌词质量、人声情感表达及创作控制力上实现全面升级,音乐织体更丰富自然,歌声情感张力与发音清晰度显著提升,创作者可精准调整节奏与时长,标志 AI 音乐创作加速迈向专业应用场景。

2026-07-30 10:50
1
0

OpenAI 推出 GPT-5.6 模型家族,包括 Sol、Terra 与 Luna 三款模型

OpenAI 推出 GPT-5.6 模型家族,包括 Sol、Terra 与 Luna 三款模型

OpenAI 正式发布 GPT-5.6 模型家族:旗舰 Sol、均衡 Terra 与高性价比 Luna。在推理优化与 agentic harness 升级下,端到端成本大幅降低、token 生成效率提升超15%。Sol 在编码智能体基准中超越竞品且 API 成本仅为一半,Terra 性能相当但价格腰斩,Luna 定价更低80%。为开发者提供弹性选择,推动 AI 规模化落地。

2026-07-30 10:49
2
0

MCP协议迎来问世以来最大改版:彻底无状态,全面适配Serverless

MCP协议迎来问世以来最大改版:彻底无状态,全面适配Serverless

Anthropic 7月28日发布MCP协议第5版,彻底转向无状态架构:移除握手和会话ID,完美适配Serverless部署(AWS Lambda、Cloudflare Workers)。新增版本化扩展框架,支持MCP Apps & Tasks,强化OAuth 2.0/OIDC企业认证,解决AI智能体大规模生产部署的架构瓶颈。

2026-07-29 17:37
1
0

亚马逊开始控制AI成本:减少调用外部模型,资源转向前沿研究

亚马逊开始控制AI成本:减少调用外部模型,资源转向前沿研究

亚马逊内部文件显示,已优化Alexa语音助手,减少对Anthropic Claude模型的调用,转向自研模型,提升GPU利用率,预计每个计算单元任务量增加4倍以上。这一举措旨在控制AI运营成本,应对云成本激增(Alexa+预计今年17亿美元),并聚焦前沿模型经济性,成为AI竞争下一个关键焦点。

2026-07-29 15:27
3
0

Fish Audio 周年发布 S2.1 Pro 实时对话语音模型 支持耳语与情绪控制

Fish Audio 周年发布 S2.1 Pro 实时对话语音模型 支持耳语与情绪控制

Fish Audio周年重磅发布S2.1Pro实时对话语音大模型!支持耳语、情绪控制与短样本克隆,90毫秒低延迟,支持83种语言。鱼声音频API已上线,提供免费测试限额。开启语音AI新纪元,让对话更自然流畅。

2026-07-29 15:18
6
0

亚马逊调整AI战略:停止研发大部分Nova自研模型,资源转向皮特·阿贝尔团队

亚马逊调整AI战略:停止研发大部分Nova自研模型,资源转向皮特·阿贝尔团队

亚马逊宣布重大AI战略调整:停研大部分Nova自研大模型(包括旗舰Nova Premier、Omni、Reel视频及Canvas图像生成器),资源转向皮特·阿贝尔领导的前沿模型团队。新基础模型预计秋季在re:Invent上发布。亚马逊仍为Anthropic和OpenAI最大支持者,强调AI为核心。调整显示从“多线铺开”转向“集中资源攻坚顶级前沿模型”,强化云与外部投资,力争重塑大模型竞争地位。

2026-07-29 15:18
4
0

OpenRouter 推出专用 LangChain 集成包,一行字符串切换 400 款模型并支持故障自动绕行

OpenRouter 推出专用 LangChain 集成包,一行字符串切换 400 款模型并支持故障自动绕行

OpenRouter 正式推出官方 LangChain 集成包(Python 与 TypeScript 版),开发者只需修改一行 provider/model 字符串,即可无缝接入超400款模型和70多家提供商。集成包自动承担负载均衡、30秒内故障绕行、跨提供商转移及成本优化等复杂路由逻辑,让链路代码完全无感知,大幅降低多模型应用的工程维护成本。

2026-07-29 11:51
3
0

具身智能开源合辑:从数据集到仿真平台覆盖全链路

具身智能开源合辑:从数据集到仿真平台覆盖全链路

本文精选ICRA 2026具身智能最强开源项目,从数据集(AGIBOT WORLD、UNIC)到仿真平台(Genie Sim、RealMirror),覆盖数据、仿真、模型、硬件全链路。提供深度解析与资源表格,助力研究者快速追踪领域前沿开源进展。

2026-07-29 11:41
14
0

OpenAI 发布两款更灵的转录模型,Whisper 相较之下差距拉开一倍

OpenAI 发布两款更灵的转录模型,Whisper 相较之下差距拉开一倍

OpenAI 7月29日正式开放两款新转录模型:GPT-Live-Transcribe(实时、低延迟)和 GPT-Transcribe(批量异步)。模型能理解上下文、口音、术语及带噪环境,准确率大幅超越老前辈 Whisper,在 Common Voice 等基准上错误率降低逾一倍,显著降低语音交互门槛。

2026-07-29 10:33
2
0

机器人为什么要拟人?人形不仅是外形,更是机器人的数据接口

机器人为什么要拟人?人形不仅是外形,更是机器人的数据接口

人形机器人为何必须拟人?本文解读 Human-as-Humanoid 论文的核心洞见:拟人不仅是外形,更是一种高效的数据接口。通过将人类第一/第三视角视频转换为 PrimeU 60DoF 动作标签,实现本体、感知与动作三层对齐,显著提升演示吞吐量并降低数据获取门槛。解决了机器人适应人类环境的根本问题,为具身智能提供可执行的学习路径。

2026-07-28 18:00
618
0

世界模型实现触觉,50万小时视频训练出首个隐式触觉世界动作模型

世界模型实现触觉,50万小时视频训练出首个隐式触觉世界动作模型

量子位 BeingBeyond 智在无界推出首个基于人类视频数据的隐式触觉世界动作模型 Being-H0.8。通过50万小时UniHand-3.0数据集与创新架构(MoT混合Transformer、通用触觉编码器、慢-快动作专家),它让机器人提前预判接触、实时读取触觉反馈并调整动作。成功实现包中取物、写字、挤牙膏等高难度精巧任务,填补了触觉进入世界模型的空白,推动具身智能新突破。

2026-07-28 18:00
747
0

海光 DCU 适配 Kimi K3:国产 GPU 运行万亿参数大模型实现 896 专家并行无卡顿

海光 DCU 适配 Kimi K3:国产 GPU 运行万亿参数大模型实现 896 专家并行无卡顿

海光 DCU 成功适配月之暗面 Kimi K3 万亿参数 MoE 模型,896 专家并行推理稳定高效。无需代码修改,模型代码可直接迁移,性能折损仅 12% 内,开发者可轻松部署长上下文智能体与创作场景。国产算力首次稳固托起万亿大模型,加速国产算力生态落地与智能时代算力版图重构。

2026-07-28 16:29
2
0

地瓜机器人开源X-Lens:4000万参数模型实时输出真实尺度深度

地瓜机器人开源X-Lens:4000万参数模型实时输出真实尺度深度

地瓜机器人开源X-Lens深度估计模型,仅4000万参数,即时处理任意鱼眼+针孔相机混合输入,输出带真实尺度的稠密深度图。统一光线表征、多视角校准Token及雅可比畸变偏置等创新设计,让机器人端侧在旭日S600芯片上20+ FPS实时运行,无需海量参数即可获得绝对深度,为精准三维感知和操作提供关键技术。

机器人大讲堂 2026-07-28 14:51
11
0

微软发布首款安全模型与智能体作战系统 MDASH:在 Cyber Gym 中超越 Gemini 和 GPT

微软发布首款安全模型与智能体作战系统 MDASH:在 Cyber Gym 中超越 Gemini 和 GPT

微软在旧金山活动上重磅推出首款网络安全专用模型 MAI-Cyber-1-Flash 及新一代智能体安全平台 Perception。MDASH 漏洞识别与修复框架让红队、蓝队、绿队智能体协同作战,在 Cyber Gym 基准上全面超越 Gemini、GPT 等竞品。穆斯塔法·苏莱曼表示系统将快速进入生产环境,为企业带来 AI 对 AI 的安全革命性跃迁。

2026-07-28 10:44
3
0

Kimi K3权重正式落地:全球首个3万亿开源模型

Kimi K3权重正式落地:全球首个3万亿开源模型

月之暗面将Kimi K3(280亿参数、激活1040亿、100万token上下文)的完整权重正式上传Hugging Face,开启全球首个3万亿开源模型时代。权重开源仅11天,AI基准指数全球第三,领跑前端竞技场;但新License含隐形条款,商业变现受限,价格却远低于Claude 5.6。技术、商业与政策博弈并存,预示开源模型如何重塑AI生态。

2026-07-28 10:30
8
0