Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次切换的视觉化对话。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级虚拟形象对话的落地边界。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次切换的视觉化对话。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级虚拟形象对话的落地边界。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,并开源生成流程,读者可了解开放科学在疫情准备中的具体做法。
Remedy Entertainment 的 CONTROL Resonant 已在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪与最高 5K HDR,无需 100GB 本地安装。
Google DeepMind 公布 Private AI Compute 架构更新,将为其加入持久化、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。新架构把协助所需信息封存在加密存储中,解密密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。
推荐理由:Google 给出私有 AI 计算加入持久化服务端记忆的架构思路,读者可了解云端记忆如何与端侧密钥结合。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成的可控程度。
Emerald AI、Google 和 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调节用电。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 开放学术研究免费使用。
推荐理由:读者可了解 9 亿单核苷酸变异预测数据集的规模,以及 AVI 评分如何把编码与非编码区变异统一排序。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,据 Brightband 的独立实时评测。
推荐理由:官方给出分辨率、更新频率与降水精度提升幅度,可据此判断 AI 天气预报在 Google 产品中的落地程度。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴限量开放其最先进的网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型访问权限。
推荐理由:原文给出受限访问计划的能力组合与准入条件,读者可据此判断前沿网络防御能力的开放节奏。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:官方给出两个变体的能力定位、价格与开放渠道,可据此判断长程编码与网络安全场景的选型。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,官方称视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。
推荐理由:官方给出场景延长、首尾帧插值与 4K 上采样等具体能力与定价入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在密码学隔离环境中,避免模型提前接触测试题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,分为实时流式 gemini-3.5-transcribe-live 与预录音频 gemini-3.5-transcribe 两个接口。
推荐理由:官方给出流式与非流式两套 API 的 WER 数字和相对 Chirp 3 的延迟提升,可据此判断语音转写能否接入现有工作流。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 玩转 49 款 Atari 游戏,到 AlphaGo、AlphaZero、MuZero、AlphaStar,再到由 Gemini 驱动的通用智能体 SIMA 2。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的升级幅度。
Google DeepMind 发布多语种手语转文本模型 SL2T,首次将手语 AI 带入消费级产品:在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:SL2T 把多语种手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与端侧隐私设计。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预测上达到 SOTA,平均多出一天预警时间,相当于气象领域约十年的进展。
推荐理由:原文给出气旋预报精度提升与开源权重,读者可据此判断 AI 天气模型的实际可用边界。
Google DeepMind 发布 Gemini Robotics ER 2,这是其面向机器人的具身推理模型,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。
Google DeepMind 发布音乐生成模型 Lyria 3.5,并已在 Google Flow Music 上线。官方称新版本在音乐性、歌词、人声和创作控制四方面有提升:旋律结构更丰富自然,歌词质量与提示词遵循度、结构感知更好,人声更具表现力和情感且发音改善,同时可更便捷地控制输出节奏与时长。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、精细操作与多机器人协作。
推荐理由:官方给出三款模型的职责分工与开放入口,读者可据此判断机器人全身控制与多机协作的落地路径。
Google 承诺为 Genesis Mission 提供 4000 万美元的 AI tokens 和额度,用于加速科学发现前沿。该承诺以 AI 资源投入的形式支持这一科学计划。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 系列的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。
推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比数据与受限开放方式,可据此判断其成本与能力取舍。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府和科研机构用 AI 应对疫情。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 组织 12 个核心课程模块,支持 10 个模块的项目生成,并以 8 种语言提供内容,底层由 Gemini 3.5 Flash 模型驱动。首批覆盖印度 100 所试点学校。
Google DeepMind 与影视公司 A24 宣布建立首个聚焦研究的合作伙伴关系,双方将围绕多个项目展开长期研发协作,让 A24 的创作者参与塑造新技术。Google 同时已对 A24 进行投资。该合作初期聚焦打通前沿技术与下一代娱乐之间的差距,具体目标、技术产出与创作里程碑将随时间演进。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价和可用入口,读者可据此判断图像与视频生成链路的成本与选型。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它只以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全防护选项,读者可据此判断智能体跨平台自动化的落地路径。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,开发基于 Gemini 的规划审批 AI 原型,目标是把住户规划申请的处理时间缩短 50%。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理先进 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作内部威胁来监控与拦截的分层框架。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 4x 推理加速、26B MoE 与 18GB 显存门槛,读者可据此判断本地交互式工作流的可行性。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助征集,面向全球研究者。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语种并保留说话人的语调、节奏和音高。
推荐理由:官方披露了连续生成语音的取舍机制与 70+ 语种覆盖,可据此判断实时翻译的可用边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,介于边缘端 E4B 与 26B MoE 之间,也是其首个支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 推出为期三个月的 Robotics 加速器,从欧洲选出 15 家机器人初创公司,提供技术指导并开放其 AI 技术栈与 Gemini 机器人模型。入选企业覆盖物流、制造、医疗、气候与导航等领域,本周在伦敦启动。
Google DeepMind 发布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进度。
推荐理由:塞拉利昂预注册试验给出了 Guided Learning 的量化增益与师生互动数据,可了解 AI 辅助教学的实际效果与局限。
Google DeepMind 在亚太地区启动首个“AI for the Planet”加速器计划,面向该地区初创公司、研究团队和非营利组织,为期三个月。入选机构将获得专家指导,以及 Google AI 专家协助将前沿 AI 和科学 AI 模型整合进其项目或产品,计划以在新加坡的线下训练营启动。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室使用 Co-Scientist 加速衰老研究。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,可了解 AI 辅助科研从假设生成到数据分析的落地方式。