跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

2 条精选近 30 天 1 条共收录 9 条

更新

多模态的精选

9月25日周五第 1–2 条
  1. Google DeepMind发布时间:
    应用落地 · 文本

    Google 推出 Gemini 3.8 Live with Live Avatar

    Google 于9月24日推出 Gemini 3.8 Live with Live Avatar,结合近实时视频生成与语音,在后台异步调用工具时可继续交流。官方称其支持97种语言,当日已在 Gemini Enterprise 提供;自定义 Avatar 可由参考图生成,但创建目前仅向企业白名单开放。音视频输出包含 SynthID 水印,尚未宣布向免费个人用户普遍开放。

2025年3月14日周五
  1. CAC AI labeling measures发布时间:89
    应用落地 · 文本

    国家网信办等四部门印发《人工智能生成合成内容标识办法》

    国家网信办等四部门印发《人工智能生成合成内容标识办法》,规范AI生成文本、图片、音视频及虚拟场景的标识,自2025年9月1日起施行。办法适用于相关规定覆盖的网络信息服务提供者:符合规定情形的生成服务须添加用户可明显感知的显式标识,并按规定在文件元数据中写入隐式标识。传播平台须核验并添加提示,用户发布生成合成内容须主动声明、使用标识功能,任何组织和个人不得恶意删除、篡改、伪造或隐匿标识。