跳到正文
9月30日 · 周三

最新精选

9月29日周二
  1. AWS Machine Learning Blog60

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此评估长任务智能体的成本与延迟取舍。

9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 自主模糊测试流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,构建在 Security Lab Taskflow Agent 之上。

    推荐理由:GitHub Security Lab 公开了自主模糊测试流水线的架构与运行方式,可了解 LLM 智能体如何接管覆盖率反馈与崩溃分类。

9月23日周三
  1. AWS Machine Learning Blog74

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 已在 Amazon Bedrock 正式可用,API 定价明显低于上一代 GPT-5.6。GPT-6 Sol 面向每周反复出现的复杂开发与运维任务,可写功能、调试、重构与审查代码、分析数据并完成跨工具多步流程;OpenAI 内部事实性评测显示其事实错误约为 GPT-5.6 Sol 的一半。

    推荐理由:原文给出两款新模型在 Bedrock 上的定位差异、定价变化与提示词缓存等落地细节,便于判断如何按任务分配模型。

9月22日周二
  1. NVIDIA Blog62

    NVIDIA 发布 Isaac ROS 5.0,推进智能体化开源机器人开发

    NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持。

    推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。

9月10日周四
  1. OpenAI News62

    OpenAI 推出面向金融服务的 ChatGPT

    OpenAI 推出面向金融服务的 ChatGPT,内置金融数据并接入 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。

    推荐理由:官方给出金融场景的定位与能力组合,读者可据此判断 ChatGPT 在专业工作流中的切入点。

  2. OpenAI News62

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务提供编排、长时运行会话和工具调用能力。

    推荐理由:OpenAI 官方发布托管式 Agents API,读者可据此了解云端智能体的编排与长时会话能力入口。

  3. OpenAI News65

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话,并带来更强的指令遵循、自定义音色和电话(telephony)支持。

    推荐理由:OpenAI 在 API 中开放全双工语音模型,开发者可据此评估实时语音应用的接入方式。

9月8日周二
  1. OpenAI News62

    OpenAI 发布 ChatGPT Images 2.5

    OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。

    推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与输出定位,可据此判断图像生成能力的迭代方向。

9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 发布 Project HydraFusion:用多模型编排实现前沿级编码质量

    GitHub 推出研究预览版 Project HydraFusion,在 GitHub Copilot CLI 中通过 /experimental 启用,可在多个提供商的模型间做运行时编排,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。

    推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个编码基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。

9月3日周四
  1. Google DeepMind66

    Google DeepMind 推出 Fairwind Program,向政府与企业开放 Gemini 3.8 Flash Cyber

    Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴限量开放其最先进的网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型访问权限。

    推荐理由:原文给出受限访问计划的能力组合与准入条件,读者可据此判断前沿网络防御能力的开放节奏。

9月2日周三
  1. Google DeepMind71

    Google DeepMind 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,官方称视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。

    推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。

8月4日周二
  1. Microsoft Research74

    微软研究院开源 Orchard:可扩展智能体 AI 框架

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。

    推荐理由:微软研究院开源 Orchard 框架,用约 3B 激活参数在 SWE-bench Verified 上达到 69.7%,可对照其环境层与训练配方设计。

6月25日周四
  1. Google DeepMind78

    Google DeepMind 在 Gemini 3.5 Flash 中内置 computer use 能力

    Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它只以独立的 Gemini 2.5 computer use 模型形式提供。

    推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全防护选项,读者可据此判断智能体跨平台自动化的落地路径。

5月18日周一
  1. Google DeepMind65

    Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

    Google DeepMind 为实验性原型 Project Genie 推出 Street View 真实场景锚定能力,用户可选取美国地点并叠加风格,生成以真实影像为起点的可交互世界。该能力由 Maps Imagery Grounding 驱动,目前仅支持美国地点,并随 Project Genie 逐步向全球 Google AI Ultra 200 美元订阅用户(18 岁以上)开放。

    推荐理由:官方披露 Genie 接入 Street View 真实影像的方式与开放范围,可据此判断世界模型落地路径。

5月17日周日
  1. Google DeepMind66

    Google DeepMind 发布 Gemini for Science 科研工具与 Science Skills

    Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。

    推荐理由:Google DeepMind 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具,读者可据此判断智能体在科研流程中的落地位置。

  2. Google DeepMind72

    Google 将 SynthID 与 C2PA 内容验证扩展到 Search、Gemini、Chrome 和 Pixel

    Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome,此前该功能已被使用 5000 万次。

    推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可据此了解内容溯源工具的落地范围。

5月16日周六
  1. Google DeepMind66

    WeatherNext 如何帮助美国国家飓风中心预测飓风 Melissa 登陆牙买加

    Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。

    推荐理由:原文给出 WeatherNext 在飓风路径与强度预测上的实测表现,读者可据此了解 AI 天气模型的实际预报能力。

5月12日周二
  1. Google DeepMind71

    Google DeepMind 发布 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体系统,可迭代生成、辩论并演化科学假设。

    推荐理由:原文披露了多智能体系统的三阶段架构与思路锦标赛机制,并给出多个实验室的落地案例。

5月6日周三
  1. Google DeepMind74

    Google DeepMind 公布 AlphaEvolve 一年落地成果

    Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,涵盖数学、量子物理、基因组、电网优化和 Google 内部基础设施。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与商业客户,可据此判断编码智能体的实际渗透范围。

3月29日周日
  1. Google DeepMind60

    Google DeepMind 用 Gemini 重构鼠标指针,Chrome 与 Googlebook 已落地

    Google DeepMind 公布由 Gemini 驱动的 AI 指针实验,提出维持心流、展示与讲述、用这用那、把像素变成可操作实体四条交互原则,让指针理解所指内容与用户意图。

    推荐理由:Google DeepMind 公开 AI 指针的四条交互原则,并说明已落地 Chrome 与 Googlebook,读者可据此判断指向式交互的可行边界。

已经到底了