跳到正文

#多模态

今日 0 条
9月29日周二
  1. Latent Space78

    AMD 以 82 亿美元收购 World Labs,Atlas 解决稀疏重建问题

    AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在博客中回顾,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并在收购 SceniX 后推进机器人仿真能力。其近期发布的 Atlas 是一种 omni 模型架构,从 2D 图像输入预测新视角,在稀疏重建这一计算机视觉长期难题上超过专用模型,可用于机器人 RL 环境、场景生成和现实世界重建。

    推荐理由:AMD 收购 World Labs 的价格与 Atlas 在稀疏重建上的定位,能帮读者理解空间智能赛道的整合逻辑。

  2. The Verge · AI78

    AMD 以约 82 亿美元全股票交易收购 World Labs

    AMD 宣布以约 82 亿美元全股票交易收购李飞飞联合创办的 AI 研究实验室 World Labs,交易预计年底前完成。World Labs 于 2024 年成立,数月内估值达 10 亿美元,2025 年推出首个商业产品、可从提示词生成交互式 3D 世界的世界生成模型 Marble。

    推荐理由:这笔全股票交易把世界模型研究团队并入芯片厂商,读者可据此观察 AI 硬件与模型研究的整合路径。

9月26日周六
9月25日周五
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次切换的视觉化对话。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级虚拟形象对话的落地边界。

9月24日周四
  1. AWS Machine Learning Blog50

    基于 AWS 的智能体对话式视频智能方案

    该方案用 Strands Agents SDK 构建单个 AI 智能体,按用户提问在运行时编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,无需为每类问题预建固定流水线。已分析内容的响应在 1 秒内返回,新视频首次分析需 5–10 分钟。一家媒体娱乐公司借此将 200 多段数小时录像的人工审阅时间减少约 80%。

9月23日周三
9月2日周三
8月28日周五
8月13日周四
8月12日周三
  1. Google DeepMind76

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语种手语转文本模型 SL2T,首次将手语 AI 带入消费级产品:在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

    推荐理由:SL2T 把多语种手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与端侧隐私设计。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,这是其面向机器人的具身推理模型,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。

7月28日周二
7月21日周二
7月1日周三
6月9日周二
5月18日周一
  1. Google DeepMind65

    Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

    Google DeepMind 为实验性原型 Project Genie 推出 Street View 真实场景锚定能力,用户可选取美国地点并叠加风格,生成以真实影像为起点的可交互世界。该能力由 Maps Imagery Grounding 驱动,目前仅支持美国地点,并随 Project Genie 逐步向全球 Google AI Ultra 200 美元订阅用户(18 岁以上)开放。

    推荐理由:官方披露 Genie 接入 Street View 真实影像的方式与开放范围,可据此判断世界模型落地路径。

5月17日周日
5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码能力

    Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 面向智能体与编码任务,在 Terminal-Bench 2.1 上得分 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,CharXiv Reasoning 多模态理解为 84.2%,输出 token 速度是其他前沿模型的 4 倍。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放渠道,可据此判断它在长程任务中的定位。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生对其回答的偏好高于主流证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。

    推荐理由:DeepMind 公开 AI co-clinician 研究,给出医生盲评与 140 项问诊能力对比数据,可了解医疗智能体当前边界。

4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,即日起面向开发者通过 Gemini API 和 Google AI Studio 预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。

    推荐理由:官方给出音频标签控制、Elo 1211 与 70+ 语言支持,可据此判断语音生成的可控性进展。

4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人高层推理的进展。

4月3日周五