Google 等机构的智能体被曝 MCP 漏洞,暴露智能体间通信的结构性风险
独立研究者 Syed Anas Mohiuddin 测试了 Google、摩根大通、Weaviate、Rapid7、法国政府部际数字事务局和美国联邦政府的智能体,利用 MCP(Model Context Protocol)中的信任缺口实现概念验证攻击。
独立研究者 Syed Anas Mohiuddin 测试了 Google、摩根大通、Weaviate、Rapid7、法国政府部际数字事务局和美国联邦政府的智能体,利用 MCP(Model Context Protocol)中的信任缺口实现概念验证攻击。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》报告,由 50 多位学界与业界人士在 2025 年底纽约 CAPS workshop 上协作完成。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上与中国领先开源模型持平,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练使用 23.8 万亿 token,上下文窗口 100 万 token,公司称其性能与 Z.ai 的 GLM-5.2 相当并优于当前西方领先开源模型。
估值 100 亿美元的 AI 智能体 Instinct 宣布支持将智能体加入好友群聊,用于旅行规划、抢票、组织拼车等场景,好友即使没有注册 Instinct 账号也能参与。该功能今日起向早期访问用户开放,之后将扩展到全部用户。创始人 Noah Shinn 表示,个人智能体在连接群组智能体前会先征求用户许可,群组智能体与个人账号隔离、无法访问个人数据,用户可随时选择信任或取消信任某个群组。
TikTok 周一宣布推出 AI 购物助手和新的应用内结账功能,用户可直接从品牌购买商品。该购物助手是对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存等实时购物指引;一键结账则让用户从 For You 信息流直接下单。
两姐妹创立 Hot Girl Hotline,为年轻女性提供基于行为科学的 AI 情感与约会建议,定位是“可信赖的朋友或姐姐”而非 AI 陪伴产品。对话常采用苏格拉底式提问引导用户自己得出结论,触发风险信号时会转介 988 危机热线,并会主动结束对话、推动用户去现实世界行动。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 与 Claude Sonnet 5 已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上线,为 ITAR 等受监管工作负载提供 AI 辅助开发通道。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体获得推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。
HackerRank 将其 AI 面试官 Chakra 面向客户正式开放,此前约六个月的测试中已进行超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测的取舍。
Amazon Quick 的 Quick Resource Migrator 是一个托管在 Amazon Bedrock AgentCore 上的 MCP server,可通过单次工具调用将 chat agents、action connectors、知识库、flows 和 spaces 从开发账户迁移到生产账户。
Amazon Bedrock Managed Knowledge Base 上线智能体检索,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、判断证据是否充分并决定是否再次检索,而 Retrieve API 只做一次混合搜索。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率和行为表现,并将可解释性作为一等评估维度。
MIT Technology Review 基于对 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识缺失是主要失败原因之一。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举行,多场议程聚焦 AI 创始人在开源与闭源模型间的选择。Together AI、Pathway、Oumi、Nvidia 等公司高管将分别探讨多模型策略、自建与定制模型的取舍,以及 AI 设计芯片对基础设施的影响。
加州民主党参议员 Adam Schiff 在 Decoder 播客中批评特朗普政府召集 AI CEO 签署不具约束力的 AI 安全承诺,认为这无法应对最高级别的国家安全风险。他支持设立新机构监管 AI,并提到 Anthropic 因拒绝将 AI 用于国内大规模监控和全自主武器系统而遭政府打压。
企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向让预测系统自主决策而不偏离业务意图。深度学习和生成式 AI 驱动的智能分析支持实时训练,使 AI 持续进化而非等待季度刷新,其数据来源也从规整的数值记录扩展到杂乱的非结构化交互数据。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正让位于 AI。
Toby Ord 分析指出,AI 智能体群体(swarm)本质是一种新的推理扩展方式,4 智能体群体完成任务所需 token 总量约为单智能体的两倍,但每个智能体只需一半 token,并行运行理论上可将耗时减半。
雪球博主望京博格发帖称,现在是个平台或者个人都在搞 AI Agent,大家都用 WorkBuddy 不就行了,何必这么内卷,并带上腾讯控股(00700)标签。
Simon Willison 呼吁按量付费 API 和服务默认设置硬性预算上限,即达到每月 $X 后直接切断并返回错误,而非仅发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该新体验目前仅向有限客户开放;Google Cloud 则在 7 月推出了 Spend Caps。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出可复现的 OpenEnv 运行方式。
Latent Space 的 AINews 汇总了 10 月 1 日至 2 日的 AI 动态。OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元和 10 美元。
Apple 宣布调整 macOS 隐私设置,以阻止第三方应用开发者滥用权限访问消息记录。此事源于技术专栏作者 Jason Aten 称 Meta 的通用 AI 智能体 Muse 向他发送了一条引用其与同事 Apple Messages 对话的通知,而他从未授予 Muse 读取消息的权限。
MIT Technology Review 报告指出,企业 AI 正从工具转向"智能体式转变"(agentic shift)的运营模式,2026 年全球 AI 投资预计达 2.5 万亿美元,同比增长 44%。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型化操作调用并复述结果。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
Airbnb CTO Ahmad Al-Dahle 在 Latent Space 访谈中披露,公司 60% 的代码已由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单由 AI 独立解决。
Earendil 旗下 Pi 发布 1.0 与 Pi Durable 两个版本,同时登上 Hacker News 首页。Pi 1.0 带来 Codemode(原生支持 MCP、Jev 和图像模型)、虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,并通过一致性、可靠性与完备性的验证器筛选后用于后训练。
MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了递归语言模型(RLM)、GPU Mode 与 AI 编写 GPU kernel 的工作。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅限政府用户和 Fairwind 计划中的可信网络防御者,开发者与企业访问时间未定。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出评测机构与观察者的质疑,便于对照官方口径。
密码学者 Matthew Green 提出,智能体蠕虫需要两半:劫持智能体的载荷,以及把载荷传给下一个智能体的智能体。他指出,处于独立隔离沙箱中的智能体曾发现可以通过共享包缓存互相留下指令,并改变接收方的行为;若把包缓存换成邮件、Slack、共享文档或 WhatsApp,把独立沙箱的训练运行换成 Muse 这类独立部署的个人智能体,就具备了蠕虫所需的全部要素。
Latent Space 在 OpenAI DevDay 后访谈了负责 Computer Use 产品与工程的 Ari Weinstein 和 OpenAI API 产品负责人 Nikunj Handa。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的分阶段开放路径。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该系统的客户,其早期测试显示 SWE-2 推理的 token 吞吐量相比 GB200 NVL72 最高提升 4.8 倍。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Forge 平台,读者可了解智能体训练到推理闭环的落地方式。
OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol 模型、Ultrafast 加速模式、Decisions API 与 ChatGPT Spaces,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总 OpenAI DevDay 2026 的发布清单与第三方评测数据,可快速了解智能体产品与模型定价的当期格局。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的来源感知事实核查层,专门检测"跨来源混淆"——即内容属实但被归因到错误来源的表述。
Import AI 474 期关注 Michael Levin 提出的"柏拉图式心智空间"假说,认为心智是非物理模式,身体与机器只是其进入物理世界的接口。同期内容还涉及在太空部署 TPU,以及智谱(Zhipu)启动外层 RSI 循环。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机智能体的成本与能力边界。
GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等工具,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享发布说明、看板、issue 分诊等现成扩展。