DeepL Voice 是德国科隆语言人工智能企业 DeepL 推出的实时语音翻译产品,可在在线会议、面对面交谈等场景中把发言者所说的语言即时转成译文字幕或译语音频,供使用其他语言的听众理解[1][2]。它于 2024 年 11 月首次发布,最初只提供会议与对话两种译文字幕方案,此后陆续加入语音对语音输出、群组对话和面向开发者的接口[1][2]。该产品以企业用户为主要对象,需订阅后使用[2]。
定义
DeepL Voice 是一套面向实时口语交流的语音翻译产品,由 DeepL 开发并以企业订阅方式向全球提供[1]。它把说话者的语音转写成其他语言的文字字幕,或直接输出目标语言的合成语音,使语言不同的与会者和交谈对象不必借助人工口译即可沟通[2][3]。
该产品由 2017 年成立的德国科隆企业 DeepL 推出,是该公司首款以语音为处理对象的翻译解决方案[1]。与文本翻译相比,实时语音翻译需要面对句子未说完、发音含糊、延迟等待等状况,这些因素都可能造成误译[1]。
原理
早期版本的 DeepL Voice 沿用文本翻译所使用的神经网络,处理链路分为三步:先把音频识别成源语言文字,再交由翻译引擎转换成目标语言文本,最后合成为目标语言的语音[4][5]。整个流程可表示为:
graph LR
A[说话者语音] --> B[语音识别与转写]
B --> C[机器翻译]
C --> D[译文字幕]
C --> E[文本转语音]
E --> F[目标语言语音]
通过接口调用时,音频以流的形式持续发送,服务端在同一次会话中依次返回源语言的转写文本、多个目标语言的译文以及合成语音[6]。会话可以加载术语表,把公司名称、产品名、缩写和行业专有词固定为指定译法;用户也能预先登记这类词汇,以提高转写的准确度[6]。
2026 年 9 月更新的语音模型进一步保留说话者的音色、语速、节奏与语调,在一场多人对话中各位发言者的声音仍可分辨,疑问语气以及犹豫、紧迫等情绪也会进入译文[3][7]。DeepL 表示处理过程中不在服务器留存语音样本,也不为日后使用建立声音档案[7]。
发展历程
2024 年 11 月 13 日,DeepL 在柏林举办的首届旗舰活动 DeepL Dialogues 上发布 DeepL Voice,次日正式公告[1]。首批产品为用于虚拟会议的 Voice for Meetings,以及面向移动设备、支持一对一面对面交谈的 Voice for Conversations[1]。发布时语音翻译支持英语、德语、日语、韩语、瑞典语、荷兰语、法语、土耳其语、波兰语、葡萄牙语、俄语、西班牙语和意大利语共 13 种口语语言,译文字幕则覆盖 DeepL 翻译器支持的全部 33 种语言[1]。
2026 年 2 月 3 日,DeepL 发布 DeepL Voice API,开发者可将实时转写与翻译接入自建应用,流式音频输入可给出源语音的转写结果,并实时输出最多 5 种语言的译文,主要面向客服中心、业务流程外包等语音沟通频繁的场景[8]。同月,公司面向专业版接口订阅客户启动了为期六周的语音对语音口译早期体验[8]。
2026 年 4 月 16 日,DeepL 推出 Voice-to-Voice 产品套件,把语音对语音翻译扩展到会议、移动端与网页端对话、群组对话以及接口四类场景,并加入专业术语自定义功能[2]。此时支持的语言超过 40 种,包括欧盟全部 24 种官方语言以及越南语、泰语、阿拉伯语、挪威语、希伯来语、孟加拉语和塔加洛语[2]。在 DeepL 委托语言行业研究机构 Slator 执行的盲测中,96% 的语言学家更偏好 DeepL Voice,而非各会议平台自带的翻译方案[2]。
2026 年 9 月 15 日,DeepL 再次更新语音模型,语音对语音翻译在在线会议、面对面交谈和接口三种场景下全面可用,支持语言超过 30 种,并推出适用于 Windows 与 macOS 的桌面应用[3]。音色保留功能覆盖 14 种语言,可在同时翻译多名发言者时维持各自的声音特征[3]。
应用
在网络会议中,DeepL Voice 可与 Zoom、Microsoft Teams 和 Google Meet 配合使用,向与会者显示实时译文字幕,或直接播放译后语音[3]。2026 年 9 月推出的桌面应用能自动发现正在进行的会议并叠加显示字幕,用户可调整字幕大小与背景音量,也可在字幕与语音之间切换[3]。
在面对面场景中,移动端与网页端的 Voice for Conversations 支持两人或多人交谈,无需安装应用也可使用;训练、辅导、研讨会等场合可由参与者扫描二维码加入群组对话,一线员工在与多名说话者面对面互动时可获得同步语音翻译[2]。
开发者可通过语音接口把实时翻译嵌入客服中心、会议工具、一线员工应用和自研产品[3]。制造业、零售、生命科学、专业服务等行业用它支持跨国团队、客户与合作伙伴之间的协作[3]。2026 年 9 月,DeepL 成为 Salesforce Dreamforce 大会的语音人工智能合作伙伴,为 50 个舞台、1000 多场议程提供实时翻译[3]。
局限
实时口译难以完全消除等待。2026 年 4 月在首尔的一场演示中,发言人讲完后约需一到两句的时间才出现译文,DeepL 首席产品官解释,不同语言的语序与句式差异会造成实时传译的滞后[4]。公司表示会通过继续改进模型来压缩延迟[4]。
术语表在流式转写下并不总能生效。由于转写文本是逐段产生的,由多个词组成的术语若被切分到不同片段中,就可能无法匹配,词越长漏配的概率越高;对于日语、汉语、泰语等词间不空格的语言,术语边界还要依赖转写结果本身[6]。
功能覆盖的范围也不一致。语音对语音翻译支持 30 种以上语言,而保留说话者音色的能力只覆盖 14 种语言[3]。面向外部参会者、通过浏览器进行的语音对语音翻译在 2026 年 9 月仍处于测试阶段[7]。
截至 2026 年,系统仍以文字转写作为中间环节,DeepL 称后续方向是开发端到端的语音翻译模型,完全跳过这一步[5]。
参见
参考资料
- kyodonewsprwire.jp 上的网页 . kyodonewsprwire.jp [引用日期2026-09-29]
- DeepL 推出实时语音翻译功能,凭借“语音对语音”技术打破下一道语言障碍 . deepl.com [引用日期2026-09-29]
- deepl.com 上的网页 . deepl.com [引用日期2026-09-29]
- deepl-voice-to-voice-real-time-spoken-translation . thenextweb.com [引用日期2026-09-29]
- 20260417-deepl-voice-to-voice . gigazine.net [引用日期2026-09-29]
- DeepL Voice API - DeepL Documentation . deepl.com [引用日期2026-09-29]
- DeepL Voice 现可跨语言实时保留您的原声 . deepl.com [引用日期2026-09-29]
- DeepL发布实时语音识别与翻译API“DeepL Voice API” . digitaltoday.co.kr [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T09:00:49Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。