跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

7条精选相关主题多模态AI 视频产品更新

最新精选

第 1–7 条 · 共 7 条
9月25日周五
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次切换的视觉化对话。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级虚拟形象对话的落地边界。

9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成的可控程度。

9月16日周三
9月10日周四
8月27日周四
  1. Google DeepMind72

    Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe

    Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,分为实时流式 gemini-3.5-transcribe-live 与预录音频 gemini-3.5-transcribe 两个接口。

    推荐理由:官方给出流式与非流式两套 API 的 WER 数字和相对 Chirp 3 的延迟提升,可据此判断语音转写能否接入现有工作流。

6月9日周二
4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,即日起面向开发者通过 Gemini API 和 Google AI Studio 预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。

    推荐理由:官方给出音频标签控制、Elo 1211 与 70+ 语言支持,可据此判断语音生成的可控性进展。