跳到正文
9月25日周五
  1. Google Research66

    Google Research 提出 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与分钟级生成的评测结果。

  2. GitHub Blog · AI & ML65

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃定级交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热门观点:该不该读 AI 生成的代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它为模型提供训练数据之外的相关信息,能减少 token 消耗并让回答更有依据。

9月17日周四
  1. GitHub Blog · AI & ML80

    GitHub Copilot 用 Copilot 把运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了大部分代码,分布在 128 个 PR 中增量合入 main,而非一次性切换。

    推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。

9月16日周三
9月11日周五
9月9日周三
  1. Mistral AI57

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并让上百个智能体逐节点补文档,再以规划、实现、测试、审查的智能体工作流逐模块迁移,由人工在 PR 环节把关。

9月7日周一
8月31日周一
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;用 SPADE 自动生成环境;用 Hawkeye 构建更好的 GPU kernel

    METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量的加速。SPADE 通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。

8月20日周四
8月17日周一
8月10日周一
7月26日周日
  1. Berkeley AI Research42

    Berkeley AI Research 提出 ABBEL:用信念状态替代递归摘要,提升 LLM 长程交互效率

    Berkeley AI Research 提出 ABBEL 框架,将摘要的信息内容隔离并以自然语言"信念状态"(belief states)形式进行监督,用信念替代完整交互历史作为智能体的工作上下文,并通过信念评分提升性能。该方法针对递归摘要(即上下文压缩)在长程任务中性能损失显著的问题,尤其适用于协作代码生成等高质量数据稀缺的人类辅助场景。

7月7日周二