NVIDIA 在纽约气候周展示 5 家用 AI 推进清洁能源的公司
NVIDIA 在纽约气候周介绍了 5 家用 AI 推进清洁能源的公司:ThinkLabs AI 用数字孪生和智能体把电网并网评估从 30-45 天缩短到 2 分钟。
NVIDIA 在纽约气候周介绍了 5 家用 AI 推进清洁能源的公司:ThinkLabs AI 用数字孪生和智能体把电网并网评估从 30-45 天缩短到 2 分钟。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》本周首发登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck 和新支持的 Firefox 浏览器上串流游玩。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。
推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程数据,可迁移到大规模智能体协作开发。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可据此比较两代平台的推理经济性。
Emerald AI、Google 和 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调节用电。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
TypeSafe 发布 Jev,一个用 RLCD 训练、只做决策/分类/路由/打分的模型,官方称比小型前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 免费。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,用一年英国逐小时污染数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 单节点 8 块 GPU 上仅用两天完成训练。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定电力预算内提升 AI 工厂的 token 吞吐。
推荐理由:NVIDIA 官方给出 DSX 各组件在真实部署中的量化结果,可据此判断固定电力预算下算力密度的提升空间。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 系统与 DSX 平台的多项能效进展,提出以每兆瓦有效 token 数衡量 AI 基础设施。
推荐理由:NVIDIA 公布 Vera Rubin 与 DSX 平台在每兆瓦 token 产出上的多项实测数据,可据此判断 AI 工厂的能效与成本走向。
费城儿童医院(CHOP)基于开源医学影像框架 MONAI 构建心脏建模服务,把 CT、MRI、3D 超声等已有影像在数秒内生成解剖精确的儿童心脏模型,此前需熟练研究员耗时四小时。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑 10 亿 ChatGPT 用户、每秒 2200 万次请求。
GitHub 推出研究预览版 Project HydraFusion,在 GitHub Copilot CLI 中通过 /experimental 启用,可在多个提供商的模型间做运行时编排,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个编码基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
伯克利 EPIC Data Lab 提出近零推理成本时代数据系统面临三大挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成的数据系统。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 4x 推理加速、26B MoE 与 18GB 显存门槛,读者可据此判断本地交互式工作流的可行性。
Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome,此前该功能已被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可据此了解内容溯源工具的落地范围。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS)的并行结构与分解策略由外部预设,而非模型自主决定。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,涵盖数学、量子物理、基因组、电网优化和 Google 内部基础设施。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与商业客户,可据此判断编码智能体的实际渗透范围。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部故障并降低带宽需求。
推荐理由:原文给出跨数据中心异步训练在带宽、容错和混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。