Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,官方称其为迄今最便宜、最快、能力最强的小模型,平均运行成本比 Haiku 4.5 低约 75%,定价与 OpenAI 的 GPT-6 Luna 持平。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,可据此判断小模型在智能体工作流中的成本位置。
Anthropic 发布 Claude Haiku 5.5,官方称其为迄今最便宜、最快、能力最强的小模型,平均运行成本比 Haiku 4.5 低约 75%,定价与 OpenAI 的 GPT-6 Luna 持平。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,可据此判断小模型在智能体工作流中的成本位置。
Anthropic 发布快速低成本模型 Claude Haiku 5.5,定价为 $0.10/$0.50,与上月发布的 OpenAI GPT-6 Luna 完全一致,超过 100,000 tokens 后涨至 $0.50/$2.50,而 Luna 在 272,000 tokens 后仅涨至 $0.20/$0.75。
推荐理由:作者实测了 Haiku 5.5 的定价、分词器与推理档位,并对比 GPT-6 Luna,可据此判断不同用量下的成本差异。
Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和 d1-omni-600M(实验性),均基于其 LFM 构建,不生成 token 而是在单次前向传播中给出答案。
推荐理由:Liquid AI 开源两款决策模型,给出决策质量、端侧延迟与多模态输入的具体数据,可据此判断边缘场景的可用性。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-精炼推理流程,让模型在 IOI 2026 拿到 535.4/600、在 IMO 2026 拿到 30/42,均超过官方金牌线。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用到其他高难领域。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 公开 Lean 证明形式化与研究细节。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果与 Lean 形式化证明,可了解其研究路径。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。
AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。
推荐理由:Beam 以 MoE 架构和超大规模 RL 训练换取低算力成本,读者可据此判断开源模型在编码与智能体任务上的性价比路线。
OpenAI 的 GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高比 Astra Standard 模式快 8 倍。
推荐理由:原文给出 Ultrafast 模式相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅限政府用户和 Fairwind 计划中的可信网络防御者,开发者与企业访问时间未定。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出评测机构与观察者的质疑,便于对照官方口径。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的分阶段开放路径。