让 AI 成为资产而非开支:HPE 谈 AI 从按 token 消费转向自有算力
HPE 提出,当 AI 从试验走向客服、IT、研究等常驻生产负载,按 token 消费的模式会让支出变成难以预测的月度变量,企业需按自身负载测算"自持算力"的盈亏平衡点。
HPE 提出,当 AI 从试验走向客服、IT、研究等常驻生产负载,按 token 消费的模式会让支出变成难以预测的月度变量,企业需按自身负载测算"自持算力"的盈亏平衡点。
据知情人士透露,AI 推理基础设施提供商 Modal Labs 正接近完成由 Accel 领投的 7.5 亿美元融资,估值达 157.5 亿美元,较四个月前 4.65 亿美元的估值增长两倍多。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的适用边界与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 更划算。
英伟达 CEO 黄仁勋发布 Nvidia Open Agent Safety Platform,将开源软件 OpenShell 与运行在 BlueField-4 DPU 上的独立监控系统 Sentry 组合,在智能体外部加一层安全控制,称可在毫秒级隔离试图越界的智能体。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配套 Gradio 应用示例。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。工作流将文本提示生成的 PNG 经 Amazon S3 传给视频端点,再取回 MP4,并提供命令行与可选 Streamlit 界面。
基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本,由多模态 LLM 读取 UI 截图执行登录、下单、结账等关键流程。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,通过 CloudFormation 和 Terraform 模板实现适配器在多账户间的推广,并将适配器 ID 外置到 Systems Manager Parameter Store,使生产环境适配器引用更新无需重新部署应用,原本需数小时或数天的协调工作缩短至数秒。
Nvidia 发布面向 AI 智能体的安全方案,把 3 月开源的 OpenShell 沙箱软件与新的硬件看门狗 Sentry 结合,Sentry 是 BlueField-4 DPU 的参考设计。
Atlassian 联合创始人兼 CEO Mike Cannon-Brookes 在 Decoder 播客中反驳“SaaSpocalypse”论调,认为 AI 不会摧毁 SaaS 这一品类。他表示 AI 实际上正在提升 Atlassian 工具的使用量,并强调 Jira 等产品是承载工作流程的“人类工作参照”,而非工作本身发生的地方。
英伟达发布 Open Agent Safety Platform,称可在毫秒级隔离试图突破边界的 AI 智能体。该平台基于开源软件 OpenShell,运行在英伟达 Vera AI CPU 上,用户可指定智能体可访问的信息,OpenShell 会在任务执行前和执行中检查这些限制;另有独立芯片上的 Sentry 技术持续监控智能体并执行边界。
Latent Space 播客邀请 OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha,回顾 OpenRouter 从 Llama、Alpaca、Mistral 时期起步,成为服务超过 1000 万开发者的中立路由层,并解释 Stripe 收购 OpenRouter 的原因。
AWS 介绍了一套在 Amazon EKS 上结合 EFA 与 DeepEP 加速 MoE 模型强化学习后训练(RLHF/GRPO)的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 负载,用 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信,缓解跨节点带宽瓶颈。
AWS 展示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型走视觉迷宫,采用 GRPO 后训练,在固定 64 迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率,并支持实时流式响应。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,各自针对一类失败模式并协同工作。该方案已服务超过 4,000 名 AWS 高管,用于实时业务问答场景。
阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署为全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练模型。
Datacor 将 Amazon Quick Sight 嵌入其 TrackAbout 解决方案,为工业气体与焊接分销商提供交互式仪表盘和自然语言查询的自助式租赁分析。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Native Qumulo(CNQ)与 Cloud Data Fabric(CDF),可让训练计算与数据集分处不同 AWS Region 而无需复制数据。
GitHub 认为 chat 是大多数场景下错误的 AI 交互界面,并在 GitHub Copilot app 中推出 canvas——一种运行在应用内、无浏览器外壳的全栈应用,可与 agent 双向通信。
AWS 发布 WhisperX Deep Learning Container,在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点。
Google 的 Project Suncatcher 首颗试验卫星 MVP 将于 10 月 1 日发射,用于验证其轨道 AI 数据中心构想。该卫星约冰箱大小,搭载四块 Google 自研 TPU AI 加速器,太阳能板供电约 1 千瓦。
企业可用 Amazon Bedrock AgentCore Gateway 与 MCP 构建多账户 AI 智能体架构,让各业务线数据留在自有账户,仅在查询时按需流出所需数据。
Aderant 基于 Amazon Bedrock 调用 Amazon Nova Lite,为 38 人的 SierraOps 团队构建了智能工单分析器,自动完成工单的上下文收集、分类与路由。
Remedy Entertainment 的 CONTROL Resonant 已在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪与最高 5K HDR,无需 100GB 本地安装。
荷兰零售商 HEMA 基于 Amazon Bedrock AgentCore 和 MCP 构建了内部 AI 助手 HAL,把原本分散在多个门户、wiki 和服务目录中的知识集中到统一来源,并直接嵌入 HAL 聊天、Kiro、Claude 等工具中。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力。团队用一个包含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 pull request 做验证,将文档高度拆成确定性的代码几何与动态评论块两套体系,评论高度按需测量并锚定到文件、行与侧,避免滚动跳动。
该方案用 Strands Agents SDK 构建单个 AI 智能体,按用户提问在运行时编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,无需为每类问题预建固定流水线。已分析内容的响应在 1 秒内返回,新视频首次分析需 5–10 分钟。一家媒体娱乐公司借此将 200 多段数小时录像的人工审阅时间减少约 80%。
开源终端 AI 编程智能体 OpenCode 可接入 Amazon Bedrock 上的开放权重模型,推理在用户自有 AWS 账户内完成,无按席位费用。文中演示了用 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 和 NVIDIA Nemotron 3 Super 120B 配置多模型工作流,并称 Bedrock 全球跨区域推理比地理配置文件便宜约 10%。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院首次系统测量机器人本体推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
Google DeepMind 公布 Private AI Compute 架构更新,将为其加入持久化、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。新架构把协助所需信息封存在加密存储中,解密密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。
推荐理由:Google 给出私有 AI 计算加入持久化服务端记忆的架构思路,读者可了解云端记忆如何与端侧密钥结合。
Airbnb 正在扩大 GPT-6 Astra 及 OpenAI 前沿模型的使用范围,帮助工程团队排查 bug、设计系统并加快交付。
GPT-6 改进了提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟与成本的控制项。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 已在 Amazon Bedrock 正式可用,API 定价明显低于上一代 GPT-5.6。GPT-6 Sol 面向每周反复出现的复杂开发与运维任务,可写功能、调试、重构与审查代码、分析数据并完成跨工具多步流程;OpenAI 内部事实性评测显示其事实错误约为 GPT-5.6 Sol 的一半。
推荐理由:原文给出两款新模型在 Bedrock 上的定位差异、定价变化与提示词缓存等落地细节,便于判断如何按任务分配模型。
Anthropic 的 Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型,面向智能体编码、知识工作和长时任务。
推荐理由:原文给出 Claude Opus 5.5 在 Bedrock 上的定价、推理控制与安全分类器变化,便于判断迁移成本。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
TypeSafe AI 发布首个大型可编程模型 Jev,定位为面向代码消费的 System 1 模型,按每美元智能优化,官方称上线后日处理 token 已超过一万亿。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 发文阐述物理 AI 规模化部署所需的安全体系,指出安全必须覆盖硬件、软件、AI、运行环境与部署全生命周期,而非部署前的一次性检查。ABI Research 预计到 2035 年 L3-5 自动驾驶汽车保有量将达 4900 万辆,Omdia 估计 2026 至 2035 年间约 6000 万台工业机器人将部署。
NVIDIA 在开罗大埃及博物馆举办活动,展示埃及 AI 生态已进入生产规模阶段,其 Deep Learning Institute 埃及学员基数一年内增长超十倍。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体触及范围之外执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。