xAI 的 Grok 4.7 上线 Amazon Bedrock
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此评估长任务智能体的成本与延迟取舍。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此评估长任务智能体的成本与延迟取舍。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的适用边界与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 更划算。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,构建在 Security Lab Taskflow Agent 之上。
推荐理由:GitHub Security Lab 公开了自主模糊测试流水线的架构与运行方式,可了解 LLM 智能体如何接管覆盖率反馈与崩溃分类。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次切换的视觉化对话。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级虚拟形象对话的落地边界。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,并开源生成流程,读者可了解开放科学在疫情准备中的具体做法。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院首次系统测量机器人本体推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
Google DeepMind 公布 Private AI Compute 架构更新,将为其加入持久化、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。新架构把协助所需信息封存在加密存储中,解密密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。
推荐理由:Google 给出私有 AI 计算加入持久化服务端记忆的架构思路,读者可了解云端记忆如何与端侧密钥结合。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成的可控程度。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 已在 Amazon Bedrock 正式可用,API 定价明显低于上一代 GPT-5.6。GPT-6 Sol 面向每周反复出现的复杂开发与运维任务,可写功能、调试、重构与审查代码、分析数据并完成跨工具多步流程;OpenAI 内部事实性评测显示其事实错误约为 GPT-5.6 Sol 的一半。
推荐理由:原文给出两款新模型在 Bedrock 上的定位差异、定价变化与提示词缓存等落地细节,便于判断如何按任务分配模型。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,并在能力与成本之间提供不同取舍。
推荐理由:OpenAI 一次推出两款 GPT-6 模型,读者可据此了解其在能力与成本上的不同定位。
Anthropic 的 Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型,面向智能体编码、知识工作和长时任务。
推荐理由:原文给出 Claude Opus 5.5 在 Bedrock 上的定价、推理控制与安全分类器变化,便于判断迁移成本。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。
推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程数据,可迁移到大规模智能体协作开发。
OpenAI 发布一套用于追踪、调查和披露模型失准(model misalignment)的框架,同时公开六份关于模型意外或令人担忧行为的报告。
推荐理由:OpenAI 公开模型失准的追踪与披露框架,并附六份异常行为报告,可了解其安全披露机制。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可据此比较两代平台的推理经济性。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super 后训练而成,训练数据来自近三十年企业 CRM 部署的专有合成数据集。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定电力预算内提升 AI 工厂的 token 吞吐。
推荐理由:NVIDIA 官方给出 DSX 各组件在真实部署中的量化结果,可据此判断固定电力预算下算力密度的提升空间。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 系统与 DSX 平台的多项能效进展,提出以每兆瓦有效 token 数衡量 AI 基础设施。
推荐理由:NVIDIA 公布 Vera Rubin 与 DSX 平台在每兆瓦 token 产出上的多项实测数据,可据此判断 AI 工厂的能效与成本走向。
OpenAI 推出面向金融服务的 ChatGPT,内置金融数据并接入 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。
推荐理由:官方给出金融场景的定位与能力组合,读者可据此判断 ChatGPT 在专业工作流中的切入点。