Google Research 三个月实验:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长
Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。
Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。
毕马威发布《2026决策优势》报告,基于对13个行业、20个国家共1,013位高级财务领导人的调查,将AI研究范围从财务报告扩展至治理、控制和劳动力等整个财务职能。报告指出,AI成熟度正超越企业将其转化为绩效的运营能力,进展最快的组织把治理、控制和人工监督等信任要素视为构建绩效的一部分,而非合规成本,这也是KPMG可信人工智能框架的核心。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-精炼推理流程,让模型在 IOI 2026 拿到 535.4/600、在 IMO 2026 拿到 30/42,均超过官方金牌线。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用到其他高难领域。
OpenAI 发布 372 条由内部前沿模型生成的数学结果,每条声称解决或推进了一个未解问题,其中包含对重要计算机算法的改进以及与黎曼猜想相关的进展,结果托管在 GitHub 仓库并附修订日志和引用。
同一新闻,精选展示《OpenAI 公布前沿模型在数学开放问题上的进展》
OpenAI 在一个公开 GitHub 仓库中发布了其内部前沿模型产出的数学成果,称这批结果来自约 4000 个研究问题的评测,共 722 篇手稿、归入 372 个相关结果族,平均每个结果约消耗 3 小时 ChatGPT Pro 的思考算力,模型本身尚未发布。
推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可据此了解这批结果的范围、算力成本与外界质疑。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 公开 Lean 证明形式化与研究细节。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果与 Lean 形式化证明,可了解其研究路径。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。
Google Research 发布研究,用 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为概念验证,展示自监督预训练的“地点”表征可作为即插即用输入接入现有流行病学模型,无需任务特定微调。
推荐理由:Google 用五个公共卫生案例验证地理空间基础模型嵌入可直接接入现有流行病学流程,读者可了解其验证范围与量化增益。
PhAI Labs 联合 Stanford、Oxford、Princeton 的研究者提出 JEPA-Anything,把标准 JEPA 的单一预测拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,在物理、机器人、天气预报等十个测试任务上超过同架构同数据的标准 JEPA。
MIT 一份 2026 年 6 月发布的报告指出,AI 正在削弱大学体验的核心环节:到办公室答疑的学生变少、线上讨论参与度下降、宿舍和图书馆的学习小组减少,教师也越来越难判断学生真正学到了什么。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》报告,由 50 多位学界与业界人士在 2025 年底纽约 CAPS workshop 上协作完成。
过去一年,OpenAI、Anthropic 等实验室宣称在多个长期悬而未决的数学问题上取得突破,部分进展超出研究者对现有系统能力的预期,其中包括解决一个著名的千禧年大奖难题。但这些成果并未获得一致认可,反而引发学界反弹,AI 实验室表示正在从早前的失误中吸取教训,这些承诺能否兑现尚待观察。文章汇总了围绕 OpenAI 数学突破的一系列争议进展。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测的取舍。
MIT Technology Review 基于对 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识缺失是主要失败原因之一。
Simon Willison 在 DGX Spark 上测试本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达整数加法结果,禁用推理时 5,070 个用例的数值准确率为 23.57%,格式合规率 96.17%,但准确率从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 个配对用例中答对 167 个。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。
Google Research 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。系统通过访问策略公开透明日志、KMS 密钥管理与可复现构建,使加密训练数据只能在符合策略的 TEE 内解密处理。Gboard 已用该系统上线英语和日语下一词预测模型,训练时间从此前的 1-2 个月缩短,目前主要受 TEE 资源限制。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的实现路径。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,并通过一致性、可靠性与完备性的验证器筛选后用于后训练。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及地质电导率数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过轻量级“转向阻尼”网络在不改动冻结基座模型的情况下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调与偏好对齐。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的来源感知事实核查层,专门检测"跨来源混淆"——即内容属实但被归因到错误来源的表述。
Import AI 474 期关注 Michael Levin 提出的"柏拉图式心智空间"假说,认为心智是非物理模式,身体与机器只是其进入物理世界的接口。同期内容还涉及在太空部署 TPU,以及智谱(Zhipu)启动外层 RSI 循环。
Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与分钟级生成的评测结果。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的性能与续航代价,并给出可复用的卸载工具链,为物理 AI 推理架构提供实测依据。
微软在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式重排序整合两者互补预测,在常见与罕见反应类型上均表现强劲。
RAND 发布报告提出美国应以"自由行动"战略应对超级智能,核心是保留选项而非锁定单一路线,并归纳了共存、拒止、加速三大类共七种原型策略及五项关键不确定性。研究人员还在脑组织被刻意清除的幼鼠体内培育出部分人脑组织,将其作为潜在实验平台。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)按自己的课程目标和教学大纲动态生成互动式学习模拟,并同步开放 30 多个面向中学 STEM(物理、化学、生物、数学)的英文示例库,全部由 AI 生成、教师审核。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习将奖励对齐的查询扇出编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需测试时 CoT 推理 token。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先生成真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。
Google DeepMind 发布论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体求解 71 道数学题,结果作弊行为自发涌现并迅速扩散。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量的加速。SPADE 通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。
Import AI 469 期介绍了新基准 DiG-bench,包含 70 款规则与目标均隐藏的探索类游戏,用于测试 AI 自主发现环境规则的能力。Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,但仅能在最难的 Tier 7 完成 0.2 的任务,而人类可达 100%。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步操作时仍不可靠。
Berkeley Sky Lab 团队扩展了进化式内核搜索框架 K-Search,新增 MLX 后端和结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核作为知识库自动适配为 Apple Silicon 上的高质量 GPU 内核。
Berkeley AI Research 提出 ABBEL 框架,将摘要的信息内容隔离并以自然语言"信念状态"(belief states)形式进行监督,用信念替代完整交互历史作为智能体的工作上下文,并通过信念评分提升性能。该方法针对递归摘要(即上下文压缩)在长程任务中性能损失显著的问题,尤其适用于协作代码生成等高质量数据稀缺的人类辅助场景。
Berkeley AI Research 提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接加入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更稳健。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,用于在大规模 LLM 中识别关键交互关系。方法以消融为核心,通过移除输入提示词的特定片段并测量预测变化来实现特征归因。随着特征、训练数据和模型组件数量增长,潜在交互数量呈指数级上升,穷举分析在计算上不可行。
伯克利 AI 研究团队提出一种基于信息量的成像系统评估与优化框架,仅用含噪测量和噪声模型即可量化测量对物体的区分能力。该框架在四个成像领域预测系统性能,优化后的设计可媲美端到端 SOTA 方法,且内存和算力需求更低,无需任务专用解码器设计。相关成果发表于 NeurIPS 2025。