ElevenLabs 语音生态再进阶:Scribe v2 与 ElevenAgents Expressive Mode,把"会说话"升级为"会表达"

ElevenLabs 持续扩展语音生态,Scribe v2 语音识别与 ElevenAgents 表达能力增强并进,配合 Music v2、Dubbing v2,三层产品结构(创作/会话/API)同步强化。

ElevenLabs 语音生态再进阶:Scribe v2 与 ElevenAgents Expressive Mode,把"会说话"升级为"会表达"

ElevenLabs 在 2026 年持续推进其语音生态,最新更新聚焦两大主线:Scribe v2 语音识别(STT)与 ElevenAgents 的表达能力增强(Expressive Mode),并叠加 Music v2、Dubbing v2 等创作端里程碑。这家以"AI Communication Platform"自我定位的公司,正通过 ElevenCreative、ElevenAgents、ElevenAPI 三层结构,把语音从"生成"推进到"理解与会话"。

  • Scribe v2(STT):2026-01 发布,官方披露在多项语音识别基准上达到 98% 准确率,补齐了平台在"语音理解"侧的短板。
  • Expressive Mode for Agents:2026-02 推出,让客服/业务语音 Agent 不只是"回答正确",还能表达语气与情绪,提升人机对话的自然度。
  • 创作端双里程碑:Music v2 与 Dubbing v2 于 2026-05 落地,把音乐生成与多语言配音能力整体升级。
  • 三层产品结构成型:ElevenCreative(创作)、ElevenAgents(会话)、ElevenAPI(开发者)共用同一底层模型与资产体系。

版本背景

ElevenLabs 的核心资产是语音基础模型,覆盖 Text to Speech、Speech to Text、Voice Cloning、Dubbing、Music Generation、SFX 与 Image & Video 等能力。其语音模型谱系包括:Eleven Flash(75ms 超低延迟)、Eleven Multilingual v2(高拟真)、Eleven v3(高表现力)与 Scribe v2(STT,98% 准确率)。官网标注支持 70+ 语言、5000+ 预设语音库。

2026 年的更新主线,是把"语音生成"与"语音理解"放进同一条产品链路,减少企业多供应商拼接造成的音色不一致与数据孤岛问题——这也是其从"TTS 工具"升级为"语音基础设施"的关键一步。

本次版本亮点

语音理解侧:Scribe v2

  • 高准确率转写:官方披露多项基准 98% 准确率,覆盖多语言场景。
  • 支撑会话闭环:STT 与 TTS 协同,让语音 Agent 具备"听得懂—答得出"的完整闭环,而不是只做单向播报。

会话侧:ElevenAgents Expressive Mode

  • 情绪表达能力:Agent 可根据上下文调整语气与情感表达,显著改善客服场景的听感体验。
  • 业务配置能力:面向客服与业务流程提供可配置、可监控的语音与文本对话 Agent。

创作端:Music v2 与 Dubbing v2

  • Music v2:音乐生成能力整体升级,补齐创作者音频资产链路。
  • Dubbing v2:多语言配音能力增强,支撑影视与内容全球化分发。

对开发者的意义

对国内开发者与产品团队而言,ElevenLabs 的生态演进有两点值得留意。其一,语音 Agent 正在成为客服、外呼、营销触达的新载体,而"表达力"是区别于传统 IVR 的关键变量——Expressive Mode 这类能力直接影响用户对 AI 客服的接受度。其二,STT + TTS + Agent 的一体化方案,比"多家拼装"在音色一致性与数据治理上更有优势,但也要注意语音数据的合规与隐私要求。

对比来看,开源侧的 Whisper 在 STT 上提供了免费自托管的另一条路径,而 ElevenLabs 的价值在于把识别、生成与会话打包成可治理的企业级服务,二者分别适合"自建数据管道"与"快速上线"两类团队。

使用路径建议

  • 创作者:从 ElevenCreative 入手,体验语音克隆、配音与音乐生成,验证内容生产工作流。
  • 企业客服/外呼:评估 ElevenAgents 的 Expressive Mode 与监控能力,小流量试点后扩容。
  • 开发者:通过 ElevenAPI 集成 TTS/STT/Agent 能力,关注七档订阅(Free 到 Enterprise)与用量 Credits 的成本模型。

值得跟踪的方向

  1. Scribe v2 的中文与方言覆盖:多语言转写质量在国内本地化场景的实测表现。
  2. Expressive Mode 的落地场景:在客服、有声内容等场景的采纳率与用户接受度数据。
  3. 企业合规与数据安全:语音数据在国内使用的合规路径,是决定国内团队是否接入的关键前提。
版权声明:本文内容来自 ElevenLabs 官方发布 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...