在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。工作流将文本提示生成的 PNG 经 Amazon S3 传给视频端点,再取回 MP4,并提供命令行与可选 Streamlit 界面。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。工作流将文本提示生成的 PNG 经 Amazon S3 传给视频端点,再取回 MP4,并提供命令行与可选 Streamlit 界面。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。
推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与输出定位,可据此判断图像生成能力的迭代方向。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价和可用入口,读者可据此判断图像与视频生成链路的成本与选型。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,无需任务专用解码器。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测下游重建性能,优化后的设计达到端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。