Google Research 三个月实验:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长
Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。
Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,帮助旅客在规划行程时查找、比较和预订酒店。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,读者可了解无需重写 harness 的智能体 RL 训练范式与 3500 行实现。
Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统由三人团队在六个月内交付,手动生命周期步骤从 10 步以上压缩为 1 次交互,冗余告警中位数减少 65%,SRE 与数据团队间的 15 分钟报告延迟降为实时。
AWS 提出一套六周结构化培养方案,让非工程背景的业务人员用 Amazon Bedrock AgentCore、Strands Agents SDK 等工具构建可扩展的 AI 原型。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 分析根因并从预批准的 Lambda 工具白名单中选择修复动作。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超过 10 万个异常与离群点。
AWS 提出"Agentic Value Model",用于替代 RPA 时代按"节省工时×人力成本−建设成本"计算 ROI 的旧模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量智能体自动化的价值。该框架强调释放的工时只有转化为减支或可衡量的再部署产出才算价值,并以理赔分流流程为例说明修正成本、错误率等此前被忽略的收益池。
基于开源智能体系统 OpenClaw 与 Amazon Bedrock AgentCore runtime,可搭建具备长期记忆的个人 AI 助手,用 AgentCore memory 把一次性对话转为持久知识,并支持结构化元数据检索。
OpenAI 与 Ironclad 正围绕复杂的合同工作流训练和评估 AI 智能体,以推进面向专业工作的计算机操作能力。双方将合同流程作为测试场景,探索智能体在真实专业任务中的表现。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 与 Bedrock Knowledge Bases,可在航空公司应用中搭建语音旅行礼宾:旅客通过语音查询行程、改座位、更新餐食偏好、咨询政策,并可转接人工客服。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。
推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长时程智能体任务,可通过全托管 API 调用。
推荐理由:GLM 5.3 在 Bedrock 上的托管接入与提示词缓存用法,可帮助读者判断长时程编码与安全测试工作流的落地成本。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》报告,由 50 多位学界与业界人士在 2025 年底纽约 CAPS workshop 上协作完成。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 与 Claude Sonnet 5 已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上线,为 ITAR 等受监管工作负载提供 AI 辅助开发通道。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体获得推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测的取舍。
Amazon Quick 的 Quick Resource Migrator 是一个托管在 Amazon Bedrock AgentCore 上的 MCP server,可通过单次工具调用将 chat agents、action connectors、知识库、flows 和 spaces 从开发账户迁移到生产账户。
Amazon Bedrock Managed Knowledge Base 上线智能体检索,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、判断证据是否充分并决定是否再次检索,而 Retrieve API 只做一次混合搜索。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率和行为表现,并将可解释性作为一等评估维度。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型化操作调用并复述结果。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,并通过一致性、可靠性与完备性的验证器筛选后用于后训练。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的分阶段开放路径。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该系统的客户,其早期测试显示 SWE-2 推理的 token 吞吐量相比 GB200 NVL72 最高提升 4.8 倍。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Forge 平台,读者可了解智能体训练到推理闭环的落地方式。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的来源感知事实核查层,专门检测"跨来源混淆"——即内容属实但被归因到错误来源的表述。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机智能体的成本与能力边界。
GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等工具,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享发布说明、看板、issue 分诊等现成扩展。
GitHub 认为 chat 并非与 LLM 交互的最佳界面,其 GitHub Copilot app 推出 canvas——一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot agent 双向通信,也能调用第三方 API 并在本地执行代码。
Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与分钟级生成的评测结果。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃定级交给 LLM 智能体,读者可据此判断自动化安全测试的边界。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它为模型提供训练数据之外的相关信息,能减少 token 消耗并让回答更有依据。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了大部分代码,分布在 128 个 PR 中增量合入 main,而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)由 Mistral 模型驱动,将先面向法国和北美用户,英国和德国预计今年晚些时候跟进。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先生成真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并让上百个智能体逐节点补文档,再以规划、实现、测试、审查的智能体工作流逐模块迁移,由人工在 PR 环节把关。
Mistral 发布 Agentic Search,作为检索层让模型在多步循环中查找、检查和验证信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数字,可据此判断传统一次性 RAG 在长文档上的边界。