Thoughtful Things 推出 AI 采样器 Engram,把模型幻觉变成音乐
音乐初创公司 Thoughtful Things 在 Kickstarter 发起其首款乐器 Engram 的众筹,这是一款用 AI 处理输入音频、甚至"幻觉"出新声音的采样器与 groovebox。
音乐初创公司 Thoughtful Things 在 Kickstarter 发起其首款乐器 Engram 的众筹,这是一款用 AI 处理输入音频、甚至"幻觉"出新声音的采样器与 groovebox。
创始人 Tarini Padmanabhuni 的祖父曾因 AI 深度伪造语音被骗支付赎金,她随后在旧金山创立 DetectifAI,从零设计可在手机操作系统内运行的小型模型,在通话和语音消息中即时判断声音是否为 AI 生成,音频不出设备。该公司以 SDK 形式授权给手机厂商,并已为印度金融机构每月处理超 10 万通电话,用于催收和贷款文件跟进的深度伪造检测与说话人验证。
Meta 推出钥匙扣大小的 AI 助手设备 Muse Charm,计划于 12 月发售。
Google DeepMind 发布多语种手语转文本模型 SL2T,首次将手语 AI 带入消费级产品:在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:SL2T 把多语种手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与端侧隐私设计。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,介于边缘端 E4B 与 26B MoE 之间,也是其首个支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以 Apache 2.0 开放四个尺寸,并给出 Arena 排名与端侧多模态能力,便于判断开源模型与硬件部署的取舍。