跳到正文

#Agent

今日 0 条
9月25日周五
9月24日周四
  1. Latent Space34

    Foundries vs Navigators:AI 如何降低科学研究的成本

    语言模型让写代码和数据分析大幅提速,但科学研究的瓶颈仍是需数天到数周验证的物理实验,"思考变便宜了,动手没有"。生物技术行业由此分化出两类路径:Foundries 用新一代测序、多重检测和物理自动化把实验数据产出提升一个数量级,Navigators 则用 AI 模型改进决策与流程,无需自研模型或海量数据。后者对早期初创公司最易落地,实验分析从一周缩短到一小时,原本六位数的软件授权变成一天自建。

  2. AWS Machine Learning Blog50

    基于 AWS 的智能体对话式视频智能方案

    该方案用 Strands Agents SDK 构建单个 AI 智能体,按用户提问在运行时编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,无需为每类问题预建固定流水线。已分析内容的响应在 1 秒内返回,新视频首次分析需 5–10 分钟。一家媒体娱乐公司借此将 200 多段数小时录像的人工审阅时间减少约 80%。

  3. AWS Machine Learning Blog34

    如何在 Amazon Bedrock 上用开放权重模型运行 AI 编程智能体 OpenCode

    开源终端 AI 编程智能体 OpenCode 可接入 Amazon Bedrock 上的开放权重模型,推理在用户自有 AWS 账户内完成,无按席位费用。文中演示了用 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 和 NVIDIA Nemotron 3 Super 120B 配置多模型工作流,并称 Bedrock 全球跨区域推理比地理配置文件便宜约 10%。

9月23日周三
  1. Ars Technica · AI62

    微软联合行业打击 AI 辅助诈骗平台 EvilTokens,涉 12000 个账户

    微软周二表示牵头联合行业打击了一个订阅制诈骗平台 EvilTokens,该平台利用 AI 聊天机器人攻破 12000 个微软账户。该平台今年 2 月通过 Telegram 频道推出,收取 1500 美元初始费用及每月 500 美元续费,可分析受害者收件箱、筛选高价值目标并起草冒充可信联系人的诈骗邮件。

  2. AWS Machine Learning Blog74

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 已在 Amazon Bedrock 正式可用,API 定价明显低于上一代 GPT-5.6。GPT-6 Sol 面向每周反复出现的复杂开发与运维任务,可写功能、调试、重构与审查代码、分析数据并完成跨工具多步流程;OpenAI 内部事实性评测显示其事实错误约为 GPT-5.6 Sol 的一半。

    推荐理由:原文给出两款新模型在 Bedrock 上的定位差异、定价变化与提示词缓存等落地细节,便于判断如何按任务分配模型。

9月22日周二
  1. Latent Space80

    小米发布 MiMo-V2.6-Pro 与 Flash:1T-A42B 开源全模态模型,训练成本 300 万美元

    小米发布 MiMo-V2.6 系列,包含原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。

    推荐理由:小米 MiMo-V2.6-Pro 以 1T 总参数、42B 激活参数登顶开源权重榜,并公开 RL 环境与训练配方,可观察开源前沿模型的成本与透明度变化。

9月21日周一
9月19日周六
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 已死、Skills 是否杀死 MCP

    GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准接口;RAG 并未消亡,它为模型提供训练数据之外的相关信息,与 Agent、Skills、MCP 可共存于同一工作流。

9月17日周四
  1. GitHub Blog · AI & ML82

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。

    推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程数据,可迁移到大规模智能体协作开发。

9月16日周三
  1. Latent Space38

    Good Start Labs 如何用游戏训练 AI 模型并迁移到真实工作

    Good Start Labs 将《1830》铁路桌游改造成 AI 训练环境,用 30B 模型做实验:单轮问答和多轮终端智能体两种训练设计都提升了游戏内表现,但只有终端智能体设计在 Finance-Agent 基准上取得提升。该公司由 Alex Duffy 和 Tyler Marques 创立,从 Every 分拆并获得 360 万美元融资,主张把环境当作课程,通过强化学习环境教模型可验证的技能。

9月14日周一
9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot 应用新手指南:使用 diff、终端和浏览器面板

    GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需切换编辑器、终端和浏览器即可完成审查、运行和预览 AI 生成代码的完整流程。diff 面板以绿色和红色高亮显示代码增删改,终端面板支持运行项目命令并可通过 Run 按钮配置脚本,浏览器面板的 Pick & Polish 工具可选中页面元素并让智能体调整。

9月10日周四
  1. OpenAI News62

    OpenAI 推出面向金融服务的 ChatGPT

    OpenAI 推出面向金融服务的 ChatGPT,内置金融数据并接入 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。

    推荐理由:官方给出金融场景的定位与能力组合,读者可据此判断 ChatGPT 在专业工作流中的切入点。

  2. OpenAI News62

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务提供编排、长时运行会话和工具调用能力。

    推荐理由:OpenAI 官方发布托管式 Agents API,读者可据此了解云端智能体的编排与长时会话能力入口。