跳到正文
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话。

    推荐理由:官方给出 Live Avatar 的实时音视频对话能力、97 种语言切换与异步工具调用细节,可据此判断企业级多模态交互的落地形态。

  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。

    推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准名次,便于判断语音生成在创作与规模化场景的取舍。

  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。

    推荐理由:官方给出两款语音模型的基准成绩、定价定位与开发者接入渠道,可据此判断语音智能体的落地成本与能力边界。

已经到底了