跳到正文

技术方向

语音与音频 最新动态

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

1 条精选近 30 天 1 条共收录 4 条

更新

语音与音频的精选

9月25日周五第 1–1 条
  1. Google DeepMind发布时间:
    应用落地 · 文本

    Google 推出 Gemini 3.8 Live with Live Avatar

    Google 于9月24日推出 Gemini 3.8 Live with Live Avatar,结合近实时视频生成与语音,在后台异步调用工具时可继续交流。官方称其支持97种语言,当日已在 Gemini Enterprise 提供;自定义 Avatar 可由参考图生成,但创建目前仅向企业白名单开放。音视频输出包含 SynthID 水印,尚未宣布向免费个人用户普遍开放。