微软研究院发布 Echoverse:为 computer-use 智能体构建深度演化环境
微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个深度领域世界和 2 个能力世界,每个世界都复现应用的真实行为并保持跨屏幕和用户的状态一致。
推荐理由:微软研究院公开了 Echoverse 的构建流程与训练数据,读者可据此了解高保真合成环境如何提升 computer-use 智能体能力。
微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个深度领域世界和 2 个能力世界,每个世界都复现应用的真实行为并保持跨屏幕和用户的状态一致。
推荐理由:微软研究院公开了 Echoverse 的构建流程与训练数据,读者可据此了解高保真合成环境如何提升 computer-use 智能体能力。
微软研究院提出 EvoLib 框架,让大语言模型在推理阶段从自身经验中学习,无需真实标签或外部反馈,也无需更新模型参数,可应用于通过 API 部署的黑盒模型。EvoLib 把过往尝试提炼为可复用技能和反思性洞见,并通过整合与动态加权机制持续精炼、合并和重新加权知识单元,使其从单次经验走向更通用的知识。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也显著低于全上下文设置。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室使用 Co-Scientist 加速衰老研究。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,可了解 AI 辅助科研从假设生成到数据分析的落地方式。
Google DeepMind 的 Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关文献,将想法转化为可检验假设并按可行性与风险收益排序。
斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从已有药物文献中筛选出可重定位治疗肝纤维化的候选药物。
推荐理由:通过斯坦福团队用 Co-Scientist 筛选肝纤维化疗法的对照实验,展示 AI 候选药物在活细胞测试中的表现差异。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生对其回答的偏好高于主流证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。
推荐理由:DeepMind 公开 AI co-clinician 研究,给出医生盲评与 140 项问诊能力对比数据,可了解医疗智能体当前边界。