Thoughtful Things 推出 AI 采样器 Engram,把模型幻觉变成音乐
音乐初创公司 Thoughtful Things 在 Kickstarter 发起其首款乐器 Engram 的众筹,这是一款用 AI 处理输入音频、甚至"幻觉"出新声音的采样器与 groovebox。
音乐初创公司 Thoughtful Things 在 Kickstarter 发起其首款乐器 Engram 的众筹,这是一款用 AI 处理输入音频、甚至"幻觉"出新声音的采样器与 groovebox。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反响积极,尤其在讲解视频生成上刷屏。
AMD 宣布以约 82 亿美元全股票交易收购李飞飞联合创办的 AI 研究实验室 World Labs,交易预计年底前完成。World Labs 于 2024 年成立,数月内估值达 10 亿美元,2025 年推出首个商业产品、可从提示词生成交互式 3D 世界的世界生成模型 Marble。
推荐理由:这笔全股票交易把世界模型研究团队并入芯片厂商,读者可据此观察 AI 硬件与模型研究的整合路径。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配套 Gradio 应用示例。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。工作流将文本提示生成的 PNG 经 Amazon S3 传给视频端点,再取回 MP4,并提供命令行与可选 Streamlit 界面。
AWS 介绍了一套在 Amazon EKS 上结合 EFA 与 DeepEP 加速 MoE 模型强化学习后训练(RLHF/GRPO)的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 负载,用 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信,缓解跨节点带宽瓶颈。
AWS 展示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型走视觉迷宫,采用 GRPO 后训练,在固定 64 迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署为全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练模型。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,构建在 Security Lab Taskflow Agent 之上。
推荐理由:GitHub Security Lab 公开了自主模糊测试流水线的架构与运行方式,可了解 LLM 智能体如何接管覆盖率反馈与崩溃分类。
AWS 发布 WhisperX Deep Learning Container,在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,并开源生成流程,读者可了解开放科学在疫情准备中的具体做法。
开源终端 AI 编程智能体 OpenCode 可接入 Amazon Bedrock 上的开放权重模型,推理在用户自有 AWS 账户内完成,无按席位费用。文中演示了用 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 和 NVIDIA Nemotron 3 Super 120B 配置多模型工作流,并称 Bedrock 全球跨区域推理比地理配置文件便宜约 10%。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院首次系统测量机器人本体推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 落地进展,新加坡 HTX 正基于 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型开展公共安全 AI 研究。
小米发布 MiMo-V2.6 系列,包含原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:小米 MiMo-V2.6-Pro 以 1T 总参数、42B 激活参数登顶开源权重榜,并公开 RL 环境与训练配方,可观察开源前沿模型的成本与透明度变化。
微软研究院在 Nature 发表逆向合成模型 RetroChimera,它结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习式集成对两者预测排序。
Latent Space 的 AINews 汇总了 Jev 发布两天内出现的 6 个复现版本,包括基于 ModernBERT 与扩散模型的猜测、Bespoke Nimble、SemIf、Jevlike 和 Kev-0.5B 等。
Latent Space 的 AINews 汇总 9/16-9/17 动态:Anthropic 在 Claude Code 推出 Projects,单次对话可派生并行云端会话并在用户离开后继续运行,本地工作流后续支持。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,用一年英国逐小时污染数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 单节点 8 块 GPU 上仅用两天完成训练。
费城儿童医院(CHOP)基于开源医学影像框架 MONAI 构建心脏建模服务,把 CT、MRI、3D 超声等已有影像在数秒内生成解剖精确的儿童心脏模型,此前需熟练研究员耗时四小时。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中的 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预测上达到 SOTA,平均多出一天预警时间,相当于气象领域约十年的进展。
推荐理由:原文给出气旋预报精度提升与开源权重,读者可据此判断 AI 天气模型的实际可用边界。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:微软研究院开源 Orchard 框架,用约 3B 激活参数在 SWE-bench Verified 上达到 69.7%,可对照其环境层与训练配方设计。
微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个深度领域世界和 2 个能力世界,每个世界都复现应用的真实行为并保持跨屏幕和用户的状态一致。
推荐理由:微软研究院公开了 Echoverse 的构建流程与训练数据,读者可据此了解高保真合成环境如何提升 computer-use 智能体能力。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google DeepMind 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具,读者可据此判断智能体在科研流程中的落地位置。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以 Apache 2.0 开放四个尺寸,并给出 Arena 排名与端侧多模态能力,便于判断开源模型与硬件部署的取舍。