微软亚洲研究院新加坡分院成立一年:推进前沿 AI 研究、合作与人才培养
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自演化诊断智能体,并与 EDB、IMDA 等机构在物流运输、工业 AI 等领域开展合作。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自演化诊断智能体,并与 EDB、IMDA 等机构在物流运输、工业 AI 等领域开展合作。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的适用边界与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 更划算。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单、仪表盘等界面,无需编写代码或手动设计。canvas 支持用户与 agent 同时操作并即时同步状态,创建后可保存为项目共享或个人扩展,社区已在 Awesome Copilot 分享现成模板。
GitHub 认为 chat 是大多数场景下错误的 AI 交互界面,并在 GitHub Copilot app 中推出 canvas——一种运行在应用内、无浏览器外壳的全栈应用,可与 agent 双向通信。
荷兰零售商 HEMA 基于 Amazon Bedrock AgentCore 和 MCP 构建了内部 AI 助手 HAL,把原本分散在多个门户、wiki 和服务目录中的知识集中到统一来源,并直接嵌入 HAL 聊天、Kiro、Claude 等工具中。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力。团队用一个包含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 pull request 做验证,将文档高度拆成确定性的代码几何与动态评论块两套体系,评论高度按需测量并锚定到文件、行与侧,避免滚动跳动。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院首次系统测量机器人本体推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 已在 Amazon Bedrock 正式可用,API 定价明显低于上一代 GPT-5.6。GPT-6 Sol 面向每周反复出现的复杂开发与运维任务,可写功能、调试、重构与审查代码、分析数据并完成跨工具多步流程;OpenAI 内部事实性评测显示其事实错误约为 GPT-5.6 Sol 的一半。
推荐理由:原文给出两款新模型在 Bedrock 上的定位差异、定价变化与提示词缓存等落地细节,便于判断如何按任务分配模型。
Anthropic 的 Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型,面向智能体编码、知识工作和长时任务。
推荐理由:原文给出 Claude Opus 5.5 在 Bedrock 上的定价、推理控制与安全分类器变化,便于判断迁移成本。
微软研究院在 Nature 发表逆向合成模型 RetroChimera,它结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习式集成对两者预测排序。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。
推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程数据,可迁移到大规模智能体协作开发。
GitHub 日本和韩国营销负责人用 GitHub Copilot 把活动运营流程自动化:以 GitHub Issue 为工作单元,用 Issue forms 收集结构化字段、Labels 作为触发器、GitHub Actions 执行落地页复制、UTM 链接生成、报名名单清洗和 CRM 导出等任务。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需切换编辑器、终端和浏览器即可完成审查、运行和预览 AI 生成代码的完整流程。diff 面板以绿色和红色高亮显示代码增删改,终端面板支持运行项目命令并可通过 Run 按钮配置脚本,浏览器面板的 Pick & Polish 工具可选中页面元素并让智能体调整。
GitHub 推出研究预览版 Project HydraFusion,在 GitHub Copilot CLI 中通过 /experimental 启用,可在多个提供商的模型间做运行时编排,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个编码基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。
GitHub Copilot 应用支持同时运行多个 Agent 会话,每个会话运行在独立的 Git worktree 上,互不干扰,可并行推进不同任务。每个会话保留各自的上下文,用户可在会话视图里查看标题和任务进度,并随时切换而不必重新说明背景。文中以 tailspin-toys 仓库为例,演示同时让 Copilot 添加 funded sort、做无障碍审查和跑测试三个任务。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,将病理基础模型的计算需求大幅降低。GigaPath-Flash 采用 22M 参数的 ViT-S tile 编码器与 21M 参数的 LongNet slide 编码器,在 PANDA 和 EBRAINS 基准上以约 50 倍更少算力达到原版 GigaPath 3% 以内的性能。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中的 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与绳结五类拓扑关系,并区分静态推理与交互规划两个认知层级。
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时输出自由文本推理与结构化预测,覆盖报告生成、病变有无与否定、定位、多标签分类及导管位置检测等任务。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:微软研究院开源 Orchard 框架,用约 3B 激活参数在 SWE-bench Verified 上达到 69.7%,可对照其环境层与训练配方设计。
微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个深度领域世界和 2 个能力世界,每个世界都复现应用的真实行为并保持跨屏幕和用户的状态一致。
推荐理由:微软研究院公开了 Echoverse 的构建流程与训练数据,读者可据此了解高保真合成环境如何提升 computer-use 智能体能力。
微软研究院提出 EvoLib 框架,让大语言模型在推理阶段从自身经验中学习,无需真实标签或外部反馈,也无需更新模型参数,可应用于通过 API 部署的黑盒模型。EvoLib 把过往尝试提炼为可复用技能和反思性洞见,并通过整合与动态加权机制持续精炼、合并和重新加权知识单元,使其从单次经验走向更通用的知识。