Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的适用边界与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 更划算。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的适用边界与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 更划算。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院首次系统测量机器人本体推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
Google DeepMind 公布 Private AI Compute 架构更新,将为其加入持久化、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。新架构把协助所需信息封存在加密存储中,解密密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。
推荐理由:Google 给出私有 AI 计算加入持久化服务端记忆的架构思路,读者可了解云端记忆如何与端侧密钥结合。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 已在 Amazon Bedrock 正式可用,API 定价明显低于上一代 GPT-5.6。GPT-6 Sol 面向每周反复出现的复杂开发与运维任务,可写功能、调试、重构与审查代码、分析数据并完成跨工具多步流程;OpenAI 内部事实性评测显示其事实错误约为 GPT-5.6 Sol 的一半。
推荐理由:原文给出两款新模型在 Bedrock 上的定位差异、定价变化与提示词缓存等落地细节,便于判断如何按任务分配模型。
Anthropic 的 Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型,面向智能体编码、知识工作和长时任务。
推荐理由:原文给出 Claude Opus 5.5 在 Bedrock 上的定价、推理控制与安全分类器变化,便于判断迁移成本。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。
推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程数据,可迁移到大规模智能体协作开发。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可据此比较两代平台的推理经济性。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定电力预算内提升 AI 工厂的 token 吞吐。
推荐理由:NVIDIA 官方给出 DSX 各组件在真实部署中的量化结果,可据此判断固定电力预算下算力密度的提升空间。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 系统与 DSX 平台的多项能效进展,提出以每兆瓦有效 token 数衡量 AI 基础设施。
推荐理由:NVIDIA 公布 Vera Rubin 与 DSX 平台在每兆瓦 token 产出上的多项实测数据,可据此判断 AI 工厂的能效与成本走向。
GitHub 推出研究预览版 Project HydraFusion,在 GitHub Copilot CLI 中通过 /experimental 启用,可在多个提供商的模型间做运行时编排,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个编码基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 4x 推理加速、26B MoE 与 18GB 显存门槛,读者可据此判断本地交互式工作流的可行性。
Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome,此前该功能已被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可据此了解内容溯源工具的落地范围。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,涵盖数学、量子物理、基因组、电网优化和 Google 内部基础设施。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与商业客户,可据此判断编码智能体的实际渗透范围。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部故障并降低带宽需求。
推荐理由:原文给出跨数据中心异步训练在带宽、容错和混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。