在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。工作流将文本提示生成的 PNG 经 Amazon S3 传给视频端点,再取回 MP4,并提供命令行与可选 Streamlit 界面。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。工作流将文本提示生成的 PNG 经 Amazon S3 传给视频端点,再取回 MP4,并提供命令行与可选 Streamlit 界面。
Runway 推出世界模型 GWM Worlds 2 研究预览版,可将高保真视频与音频生成转为实时交互式模拟,并以 720p、24fps 视频和 48000Hz 音频流式输出。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次切换的视觉化对话。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级虚拟形象对话的落地边界。
该方案用 Strands Agents SDK 构建单个 AI 智能体,按用户提问在运行时编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,无需为每类问题预建固定流水线。已分析内容的响应在 1 秒内返回,新视频首次分析需 5–10 分钟。一家媒体娱乐公司借此将 200 多段数小时录像的人工审阅时间减少约 80%。
invideo 借助 GPT-6 Astra 实现更精准的剪辑规划,调色与色彩校正效率提升 3 倍,并在一天内产出 50 个自定义特效。
Higgsfield AI 借助 GPT-6 Astra,一天内上线新视频功能,让小型企业更轻松地制作视频广告,并更快将新创意工具推向市场。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,官方称视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。
推荐理由:官方给出场景延长、首尾帧插值与 4K 上采样等具体能力与定价入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 与影视公司 A24 宣布建立首个聚焦研究的合作伙伴关系,双方将围绕多个项目展开长期研发协作,让 A24 的创作者参与塑造新技术。Google 同时已对 A24 进行投资。该合作初期聚焦打通前沿技术与下一代娱乐之间的差距,具体目标、技术产出与创作里程碑将随时间演进。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价和可用入口,读者可据此判断图像与视频生成链路的成本与选型。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,读者可据此判断视频生成工作流的变化。