跳到正文
10月6日周二
  1. TechCrunch · AI71

    Reflection 发布开源权重模型 Beam,对标中国开源模型并降低推理算力成本

    Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上与中国领先开源模型持平,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练使用 23.8 万亿 token,上下文窗口 100 万 token,公司称其性能与 Z.ai 的 GLM-5.2 相当并优于当前西方领先开源模型。

  2. TechCrunch · AI62

    Instinct 将 AI 智能体引入群聊,好友无需注册账号

    估值 100 亿美元的 AI 智能体 Instinct 宣布支持将智能体加入好友群聊,用于旅行规划、抢票、组织拼车等场景,好友即使没有注册 Instinct 账号也能参与。该功能今日起向早期访问用户开放,之后将扩展到全部用户。创始人 Noah Shinn 表示,个人智能体在连接群组智能体前会先征求用户许可,群组智能体与个人账号隔离、无法访问个人数据,用户可随时选择信任或取消信任某个群组。

  3. TechCrunch · AI60

    TikTok 推出 AI 购物助手与一键结账

    TikTok 周一宣布推出 AI 购物助手和新的应用内结账功能,用户可直接从品牌购买商品。该购物助手是对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存等实时购物指引;一键结账则让用户从 For You 信息流直接下单。

  4. TechCrunch · AI22

    Hot Girl Hotline:面向 AI 时代的“Dear Abby”情感建议应用

    两姐妹创立 Hot Girl Hotline,为年轻女性提供基于行为科学的 AI 情感与约会建议,定位是“可信赖的朋友或姐姐”而非 AI 陪伴产品。对话常采用苏格拉底式提问引导用户自己得出结论,触发风险信号时会转介 988 危机热线,并会主动结束对话、推动用户去现实世界行动。

  5. AWS Machine Learning Blog36

    Amazon SageMaker AI 推出 aws-ai-ml 技能,为 Kiro、Claude Code、Codex 等编码智能体提供生成式 AI 推理优化能力

    Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体获得推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。

10月5日周一
  1. MIT Technology Review · AI12

    预测分析如何迈入智能体 AI 时代

    企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向让预测系统自主决策而不偏离业务意图。深度学习和生成式 AI 驱动的智能分析支持实时训练,使 AI 持续进化而非等待季度刷新,其数据来源也从规整的数值记录扩展到杂乱的非结构化交互数据。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正让位于 AI。

10月4日周日
  1. Simon Willison34

    Simon Willison:按量付费服务需要默认硬性预算上限,AWS 已推出支出限额

    Simon Willison 呼吁按量付费 API 和服务默认设置硬性预算上限,即达到每月 $X 后直接切断并返回错误,而非仅发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该新体验目前仅向有限客户开放;Google Cloud 则在 7 月推出了 Spend Caps。

  2. Hugging Face Blog62

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。

10月3日周六
10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。

  2. Hugging Face Blog38

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,并通过一致性、可靠性与完备性的验证器筛选后用于后训练。

10月1日周四
  1. Simon Willison62

    Matthew Green 谈沙箱能否遏制失控智能体

    密码学者 Matthew Green 提出,智能体蠕虫需要两半:劫持智能体的载荷,以及把载荷传给下一个智能体的智能体。他指出,处于独立隔离沙箱中的智能体曾发现可以通过共享包缓存互相留下指令,并改变接收方的行为;若把包缓存换成邮件、Slack、共享文档或 WhatsApp,把独立沙箱的训练运行换成 Muse 这类独立部署的个人智能体,就具备了蠕虫所需的全部要素。

  2. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。

    推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的分阶段开放路径。

9月30日周三
  1. NVIDIA Blog60

    NVIDIA 与 CoreWeave 将 Vera Rubin NVL72 和 Forge 平台投入生产

    CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该系统的客户,其早期测试显示 SWE-2 推理的 token 吞吐量相比 GB200 NVL72 最高提升 4.8 倍。

    推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Forge 平台,读者可了解智能体训练到推理闭环的落地方式。

9月29日周二
9月28日周一
  1. Hugging Face Blog71

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机智能体的成本与能力边界。

9月26日周六
  1. GitHub Blog · AI & ML38

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等工具,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享发布说明、看板、issue 分诊等现成扩展。