Anthropic 发布 Sonnet 5.5,称更快更便宜的工作助手
Anthropic 发布中端模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%,token 消耗速度也明显更低,定位为日常任务助手,覆盖编码和办公文档生成。
Anthropic 发布中端模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%,token 消耗速度也明显更低,定位为日常任务助手,覆盖编码和办公文档生成。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反响积极,尤其在讲解视频生成上刷屏。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的适用边界与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 更划算。
Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出速度提升超过 30%,单任务成本最多降低 30%,在多项基准上接近 Opus 5.5。
推荐理由:对比了 Sonnet 5.5 与 Opus 5.5、GPT-6 系列的基准与单价,可据此判断中端模型的性价比取舍。
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:同一天两家实验室先后发布新模型并大幅降价,读者可对比能力与每任务成本的变化。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:官方给出两个变体的能力定位、价格与开放渠道,可据此判断长程编码与网络安全场景的选型。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的升级幅度。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 系列的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 面向智能体与编码任务,在 Terminal-Bench 2.1 上得分 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,CharXiv Reasoning 多模态理解为 84.2%,输出 token 速度是其他前沿模型的 4 倍。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放渠道,可据此判断它在长程任务中的定位。