AI 行业动态/2026.09.25

Gemini 加入实时虚拟形象,千问语音模型升级降价

应用侧,Gemini 为企业实时对话加入虚拟形象,达摩院探索平扫 CT 食管癌筛查;开发侧,千问下调语音模型价格,Anthropic 展示智能体参与生物发现的流程与边界。

2026 / 0925ISSUE
虚拟角色与声音轨道连接到实验观察台,表现可视化对话和 AI 科研探索。
本期主题AI 生成概念插图
01

应用与工具

新工具、新功能,以及它们能帮你完成什么。

2 条
01

Gemini 实时对话加入虚拟形象,面向企业开放

Google DeepMind 9 月 24 日宣布,Gemini 3.8 Live 新增 Live Avatar,可用于企业客服、交互讲解等场景,已在 Gemini Enterprise 提供。这是实时对话模型的视觉形象升级。

据官方介绍,它能同时处理声音和视觉输入,以带表情、口型同步的视频形象回应;查询数据等工具任务可在后台执行,对话继续进行。官方称其支持在 97 种语言间切换,并提供预设形象。通过参考图片创建自定义形象目前仅向企业白名单开放,生成的音视频带有用于识别 AI 内容的 SynthID 水印。

AI 简评

企业评估时可分别验证对话连贯性与后台任务完成情况;形象定制还需要满足白名单条件。

02

达摩院用平扫 CT 筛查食管癌风险

据 IT之家 9 月 24 日报道,阿里达摩院联合多家医院研发食管癌筛查模型 DAMO EAGLE,利用不需造影的平扫 CT 识别风险,相关论文于 9 月 22 日发表于《自然·医学》。其用途是帮助筛出高风险人群,再接受内镜检查。

报道援引论文称,模型在三个国家的八万多病例中获得验证。在机会性筛查场景,即利用已有检查顺带筛查其他疾病时,食管癌敏感性为 90%,癌前病变敏感性为 52.5%;真实场景特异性为 99.2%。敏感性衡量发现病变的能力,特异性衡量正确排除非病变的能力,两者不能混作总体准确率。

AI 简评

这项研究的应用价值在于利用已有胸部 CT 增加风险筛查机会;研究指标不能直接等同于个人诊断结果。

02

技术与开发

模型、API、开源与工程实践,关注能力和使用边界。

2 条
03

千问升级音频模型,全线语音产品降价

回看 9 月 23 日,IT之家报道千问发布 Qwen-Audio-3.1 系列,涵盖语音识别、语音合成、实时交互,以及新增的音频理解和创作模型。报道转述官方降价口径:语音合成约降 70%,实时交互约降 85%,语音识别降 95%。这些是相对降幅,不能直接换算成具体调用账单。

语音识别模型支持输出说话人、时间戳和文本,并可去除重复表达、重组语义。TTS-Next 音频创作模型可统一生成人声、音效和环境音,支持时间戳控制及 48kHz 输出。Realtime 支持同时听和说,允许用户插话,并可调用接口、知识库与业务系统完成任务。

AI 简评

转写润色适合整理会议纪要;需要逐字追溯的业务,应保留原始音频并核对整理后的文本。

04

Claude 辅助发现新酶系统,功能仍待验证

Anthropic 9 月 23 日公布生命科学团队的早期成果:Claude 在 DNA 数据中识别出名为 ART 的新酶系统。它围绕逆转录酶展开;逆转录酶是将 RNA 复制为 DNA 的酶,相关酶本身此前已有研究,新增发现涉及相邻的重复序列与辅助蛋白。

据官方披露,此次搜索约有 950 个智能体参与,持续 21 小时、消耗 2.1 亿词元。科学家提供初始方向并完成全部实验工作。早期实验显示相关重复序列会表达为短 RNA,但 ART 的主要功能仍在研究中,尚不能据此认定它已成为可用的基因编辑工具。

AI 简评

对科研智能体开发者,更有参考价值的是候选筛选、人工复核与实验验证的流程,而非把候选发现直接视为功能确证。

AFTER READING

读完之后

本期关注可视化对话、语音成本与科研应用;企业开放条件和实验验证范围,仍是判断能否采用的关键。

编辑说明与生成信息

由 AI 根据所列来源整理,简评为 AI 分析;封面为 AI 生成概念插图。

资料截止时间:2026-09-25T00:30:32.386500Z

首次生成时间:2026/09/25 09:00(北京时间)。本版更新时间:2026/09/25 09:00(北京时间)。实际发布时间:2026/09/25 09:00(北京时间)。

评论

来聊聊吧