跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–16 条 · 共 16 条
9月29日周二
9月24日周四
  1. Microsoft Research60

    微软研究院:把物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院首次系统测量机器人本体推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。

  2. Google DeepMind62

    Google DeepMind 为 Private AI Compute 引入安全服务端记忆

    Google DeepMind 公布 Private AI Compute 架构更新,将为其加入持久化、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。新架构把协助所需信息封存在加密存储中,解密密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。

    推荐理由:Google 给出私有 AI 计算加入持久化服务端记忆的架构思路,读者可了解云端记忆如何与端侧密钥结合。

9月23日周三
  1. AWS Machine Learning Blog74

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 已在 Amazon Bedrock 正式可用,API 定价明显低于上一代 GPT-5.6。GPT-6 Sol 面向每周反复出现的复杂开发与运维任务,可写功能、调试、重构与审查代码、分析数据并完成跨工具多步流程;OpenAI 内部事实性评测显示其事实错误约为 GPT-5.6 Sol 的一半。

    推荐理由:原文给出两款新模型在 Bedrock 上的定位差异、定价变化与提示词缓存等落地细节,便于判断如何按任务分配模型。

9月22日周二
9月17日周四
  1. GitHub Blog · AI & ML82

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。

    推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程数据,可迁移到大规模智能体协作开发。

9月16日周三
9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 发布 Project HydraFusion:用多模型编排实现前沿级编码质量

    GitHub 推出研究预览版 Project HydraFusion,在 GitHub Copilot CLI 中通过 /experimental 启用,可在多个提供商的模型间做运行时编排,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。

    推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个编码基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。

    推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。

6月11日周四
5月17日周日
5月6日周三
  1. Google DeepMind74

    Google DeepMind 公布 AlphaEvolve 一年落地成果

    Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,涵盖数学、量子物理、基因组、电网优化和 Google 内部基础设施。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与商业客户,可据此判断编码智能体的实际渗透范围。

4月22日周三
  1. Google DeepMind62

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部故障并降低带宽需求。

    推荐理由:原文给出跨数据中心异步训练在带宽、容错和混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。