跳到正文
今天10月8日周四1 条
  1. Google Research71

    Google Research 三个月实验:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长

    Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。

10月6日周二
10月5日周一
10月4日周日
  1. Hugging Face Blog62

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。

10月2日周五
  1. Hugging Face Blog38

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,并通过一致性、可靠性与完备性的验证器筛选后用于后训练。

9月29日周二
9月25日周五
  1. Google Research66

    Google Research 提出 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与分钟级生成的评测结果。

9月11日周五
9月7日周一
7月26日周日
  1. Berkeley AI Research42

    Berkeley AI Research 提出 ABBEL:用信念状态替代递归摘要,提升 LLM 长程交互效率

    Berkeley AI Research 提出 ABBEL 框架,将摘要的信息内容隔离并以自然语言"信念状态"(belief states)形式进行监督,用信念替代完整交互历史作为智能体的工作上下文,并通过信念评分提升性能。该方法针对递归摘要(即上下文压缩)在长程任务中性能损失显著的问题,尤其适用于协作代码生成等高质量数据稀缺的人类辅助场景。