跳到正文
  1. Hugging Face Blog60

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-精炼推理流程,让模型在 IOI 2026 拿到 535.4/600、在 IMO 2026 拿到 30/42,均超过官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用到其他高难领域。

  1. GitHub Blog · AI & ML62

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测的取舍。

  1. Hugging Face Blog62

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。

已经到底了