跳到正文
  1. Google Research66

    Google Research 提出 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与分钟级生成的评测结果。

  2. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音结合,为 Gemini 的实时对话模型加入动态视觉形象,具备精准唇形同步、自然表情和流畅轮次切换。

    推荐理由:官方给出实时视频与语音耦合的对话能力、异步工具调用和 97 种语言切换等具体细节,可据此判断企业级数字人交互的落地边界。

已经到底了