xAI 的 Grok 4.7 上线 Amazon Bedrock
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此评估长任务智能体的成本与延迟取舍。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此评估长任务智能体的成本与延迟取舍。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的适用边界与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 更划算。
基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本,由多模态 LLM 读取 UI 截图执行登录、下单、结账等关键流程。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单、仪表盘等界面,无需编写代码或手动设计。canvas 支持用户与 agent 同时操作并即时同步状态,创建后可保存为项目共享或个人扩展,社区已在 Awesome Copilot 分享现成模板。
AWS 展示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型走视觉迷宫,采用 GRPO 后训练,在固定 64 迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
GitHub 认为 chat 是大多数场景下错误的 AI 交互界面,并在 GitHub Copilot app 中推出 canvas——一种运行在应用内、无浏览器外壳的全栈应用,可与 agent 双向通信。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,构建在 Security Lab Taskflow Agent 之上。
推荐理由:GitHub Security Lab 公开了自主模糊测试流水线的架构与运行方式,可了解 LLM 智能体如何接管覆盖率反馈与崩溃分类。
企业可用 Amazon Bedrock AgentCore Gateway 与 MCP 构建多账户 AI 智能体架构,让各业务线数据留在自有账户,仅在查询时按需流出所需数据。
Aderant 基于 Amazon Bedrock 调用 Amazon Nova Lite,为 38 人的 SierraOps 团队构建了智能工单分析器,自动完成工单的上下文收集、分类与路由。
荷兰零售商 HEMA 基于 Amazon Bedrock AgentCore 和 MCP 构建了内部 AI 助手 HAL,把原本分散在多个门户、wiki 和服务目录中的知识集中到统一来源,并直接嵌入 HAL 聊天、Kiro、Claude 等工具中。
该方案用 Strands Agents SDK 构建单个 AI 智能体,按用户提问在运行时编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,无需为每类问题预建固定流水线。已分析内容的响应在 1 秒内返回,新视频首次分析需 5–10 分钟。一家媒体娱乐公司借此将 200 多段数小时录像的人工审阅时间减少约 80%。
开源终端 AI 编程智能体 OpenCode 可接入 Amazon Bedrock 上的开放权重模型,推理在用户自有 AWS 账户内完成,无按席位费用。文中演示了用 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 和 NVIDIA Nemotron 3 Super 120B 配置多模型工作流,并称 Bedrock 全球跨区域推理比地理配置文件便宜约 10%。
Ringg 基于 GPT-5.6 构建的 AI 智能体可解决最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页等多语言场景。相比 GPT-4.1,其成本降低 90%。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 落地进展,新加坡 HTX 正基于 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型开展公共安全 AI 研究。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 已在 Amazon Bedrock 正式可用,API 定价明显低于上一代 GPT-5.6。GPT-6 Sol 面向每周反复出现的复杂开发与运维任务,可写功能、调试、重构与审查代码、分析数据并完成跨工具多步流程;OpenAI 内部事实性评测显示其事实错误约为 GPT-5.6 Sol 的一半。
推荐理由:原文给出两款新模型在 Bedrock 上的定位差异、定价变化与提示词缓存等落地细节,便于判断如何按任务分配模型。
Anthropic 的 Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型,面向智能体编码、知识工作和长时任务。
推荐理由:原文给出 Claude Opus 5.5 在 Bedrock 上的定价、推理控制与安全分类器变化,便于判断迁移成本。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
Parallel 借助 GPT-6 Astra 让智能体完成劳动力市场数据的调研与综合,耗时和成本均降至此前模型的一半。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体触及范围之外执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
V7 使用 GPT-5.6 将分散的公司文件转化为智能体可用的上下文,以完成复杂且带来源链接的工作,同时成本降低 78%、准确率提升。
GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准接口;RAG 并未消亡,它为模型提供训练数据之外的相关信息,与 Agent、Skills、MCP 可共存于同一工作流。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。
推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程数据,可迁移到大规模智能体协作开发。
OpenAI 发布 OpenAI for Law,为法律行业提供前沿智能、律所自定义工作流、连接的法律数据源,以及针对机密客户工作的法律级管控。
OpenAI 推出 AI 广告新体验,包括 Sponsored Agents 以及面向营销人员的工具,并接入 HubSpot 和 Shopify。
Hex 借助 GPT-6 Astra 让数据智能体把分析答案转化为可交互的可视化报告,供员工直接分享。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super 后训练而成,训练数据来自近三十年企业 CRM 部署的专有合成数据集。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位。
Fyxer 基于 OpenAI 模型、微调、记忆与真实用户反馈,为每位用户整理收件箱并按本人语气起草邮件。该产品定位为可被信任的 AI 行政助理。
Perplexity 采用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
GitHub 日本和韩国营销负责人用 GitHub Copilot 把活动运营流程自动化:以 GitHub Issue 为工作单元,用 Issue forms 收集结构化字段、Labels 作为触发器、GitHub Actions 执行落地页复制、UTM 链接生成、报名名单清洗和 CRM 导出等任务。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需切换编辑器、终端和浏览器即可完成审查、运行和预览 AI 生成代码的完整流程。diff 面板以绿色和红色高亮显示代码增删改,终端面板支持运行项目命令并可通过 Run 按钮配置脚本,浏览器面板的 Pick & Polish 工具可选中页面元素并让智能体调整。
OpenAI 宣布在 ChatGPT Work 中上线 Data agent,面向所有人开放。该功能可连接公司数据、发现洞察,并用自然语言让 AI 构建交互式仪表盘。
OpenAI 推出面向金融服务的 ChatGPT,内置金融数据并接入 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。
推荐理由:官方给出金融场景的定位与能力组合,读者可据此判断 ChatGPT 在专业工作流中的切入点。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务提供编排、长时运行会话和工具调用能力。
推荐理由:OpenAI 官方发布托管式 Agents API,读者可据此了解云端智能体的编排与长时会话能力入口。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、计算机操作能力,并在写作和设计判断上更强。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力定位,读者可据此了解其推理与计算机操作方向。
OpenAI 披露内部数据,展示编程智能体正在重塑其 AI 研究流程,涉及智能体使用情况、实验速度、任务复杂度与研究加速等方面。
GitHub 推出研究预览版 Project HydraFusion,在 GitHub Copilot CLI 中通过 /experimental 启用,可在多个提供商的模型间做运行时编排,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个编码基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。
GitHub Copilot 应用支持同时运行多个 Agent 会话,每个会话运行在独立的 Git worktree 上,互不干扰,可并行推进不同任务。每个会话保留各自的上下文,用户可在会话视图里查看标题和任务进度,并随时切换而不必重新说明背景。文中以 tailspin-toys 仓库为例,演示同时让 Copilot 添加 funded sort、做无障碍审查和跑测试三个任务。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴限量开放其最先进的网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型访问权限。
推荐理由:原文给出受限访问计划的能力组合与准入条件,读者可据此判断前沿网络防御能力的开放节奏。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:官方给出两个变体的能力定位、价格与开放渠道,可据此判断长程编码与网络安全场景的选型。