跳到正文
今天10月8日周四15 条
  1. Google Research71

    Google Research 三个月实验:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长

    Google Research 在 NBER 发布三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了实证。

  2. OpenAI News85

    OpenAI 在 ChatGPT 全球上线 GPT-6 与 Intelligent UI

    OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称其响应更快,并带来可视化与可直接探索使用的交互体验。

    推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的交互变化。

  3. NVIDIA Blog72

    NVIDIA 与 Microsoft 发布 RTX Spark 及 Windows 智能体基础设施

    NVIDIA 与 Microsoft 在旧金山 Windows AI 活动上宣布为 Windows PC 的 AI 智能体共同设计软硬件,Microsoft 宣布操作系统级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,可据此判断本地智能体的落地路径。

  4. Hugging Face Blog62

    Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧决策模型

    Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和 d1-omni-600M(实验性),均基于其 LFM 构建,不生成 token 而是在单次前向传播中给出答案。

    推荐理由:Liquid AI 开源两款决策模型,给出决策质量、端侧延迟与多模态输入的具体数据,可据此判断边缘场景的可用性。

  5. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行轻量智能体 RL 框架,支持真实 harness 训练

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,读者可了解无需重写 harness 的智能体 RL 训练范式与 3500 行实现。

  6. AWS Machine Learning Blog34

    Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统由三人团队在六个月内交付,手动生命周期步骤从 10 步以上压缩为 1 次交互,冗余告警中位数减少 65%,SRE 与数据团队间的 15 分钟报告延迟降为实时。

  7. AWS Machine Learning Blog36

    超越节省工时:如何为智能体自动化构建商业论证

    AWS 提出"Agentic Value Model",用于替代 RPA 时代按"节省工时×人力成本−建设成本"计算 ROI 的旧模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量智能体自动化的价值。该框架强调释放的工时只有转化为减支或可衡量的再部署产出才算价值,并以理赔分流流程为例说明修正成本、错误率等此前被忽略的收益池。

10月7日周三
  1. Microsoft Research22

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露传统 benchmark 之外的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细检查数据。

  2. Google Research62

    Google Earth AI 的 PDFM 地理空间基础模型在五项全球公共卫生任务中的验证

    Google Research 发布研究,用 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为概念验证,展示自监督预训练的“地点”表征可作为即插即用输入接入现有流行病学模型,无需任务特定微调。

    推荐理由:Google 用五个公共卫生案例验证地理空间基础模型嵌入可直接接入现有流行病学流程,读者可了解其验证范围与量化增益。

  3. AWS Machine Learning Blog22

    AWS 如何依据 ISO/IEC 42005:2025 帮客户落地负责任 AI 治理

    AWS 发文解读国际标准 ISO/IEC 42005:2025,说明企业如何将 AI 系统影响评估整合进整体风险治理体系。该标准覆盖评估全生命周期(范围界定与执行、分析与报告、持续监控与复审),并提供 Annex D 复用既有评估流程、Annex E 独立评估模板两套方案,还给出轻量级评估分诊方法以判断是否需要完整评估。

10月6日周二
  1. Mistral AI82

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底发布。

    推荐理由:官方给出 1 万亿参数、49B 激活的开放权重模型在编码、智能体与网络安全上的具体评测数字,可据此判断开放权重模型当前的能力边界。

  2. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长时程智能体任务,可通过全托管 API 调用。

    推荐理由:GLM 5.3 在 Bedrock 上的托管接入与提示词缓存用法,可帮助读者判断长时程编码与安全测试工作流的落地成本。

  3. AWS Machine Learning Blog36

    Amazon SageMaker AI 推出 aws-ai-ml 技能,为 Kiro、Claude Code、Codex 等编码智能体提供生成式 AI 推理优化能力

    Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体获得推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。

10月5日周一