Dia TTS - AI 语音工作室Dia TTS

语音转文字

上传音频并生成可预览、复制和导出的转写文本,支持 TXT、JSON、SRT 和 VTT 格式。

拖拽文件到此处或点击上传

MP3, OGG, WAV, M4A, AAC (最大 50MB, 最长 30分钟)

预计消耗积分3 积分 /分钟

暂无生成结果

新的生成结果会显示在这里,历史生成记录可前往「我的创作」查看。

前往我的创作

Dia TTS 语音转文字

Dia TTS 是一款基于浏览器的语音转文字和音频转录工具,可以将录音中的语音转换为可阅读的文字。上传 MP3、OGG、WAV、M4A 或 AAC 文件,即可生成转写内容。每个文件最大为 50MB,音频时长不能超过 30 分钟。当转写结果包含时间和说话人信息时,预览内容可以跟随原音频播放,区分不同说话人的发言,并支持点击文字或段落跳转到对应的音频位置。您可以复制完整文字,也可以导出 TXT、JSON、SRT 或 VTT 文件。当前页面采用上传音频后进行处理的方式,不是实时语音输入、视频上传或音频翻译工具。

真实效果展示

由 Dia TTS 生成的真实示例。

输入

输出

为什么使用 Dia TTS 语音转文字

🎙️
支持常见音频格式的音频转文字

将 MP3、OGG、WAV、M4A 和 AAC 文件中的语音转换为可阅读的文字。每次上传的文件最大为 50MB、最长为 30 分钟,适合处理录音、访谈、播客片段、课程和其他有声内容。

⏱️
结合原音频查看转写内容

您可以在收听原始录音的同时查看转写文本。当结果包含词级时间信息时,文字会跟随播放进度,并支持点击词语或段落跳转到录音中的对应位置。当识别到说话人信息时,不同说话人的内容会分别展示。

📄
导出 TXT、JSON、SRT 或 VTT

复制完整文字,或者根据后续用途选择导出格式。TXT 适合普通文字处理,JSON 保留结构化转写数据,SRT 和 VTT 则适合字幕工作流。导出字幕时,还可以设置说话人标签、标点、受支持的音频标签、字幕分组方式,以及 VTT 的词级时间戳。

🌐
基于浏览器,并可使用赠送积分试用

无需安装音频转录软件。上传音频、查看结果和导出文件都可以直接在浏览器中完成。新用户注册后可以使用赠送积分试用语音转文字。积分消耗根据上传音频的时长计算,并以分钟为计费单位。

如何将音频转换为文字

1

上传清晰的音频文件

选择一段 MP3、OGG、WAV、M4A 或 AAC 录音。文件不能超过 50MB,音频时长不能超过 30 分钟。

  • 确保语音清晰、音量足够
  • 让人声尽量高于背景音乐和环境噪声
  • 避免明显回声、爆音和严重压缩
  • 尽量减少多人同时说话
  • 剪掉没有有效语音的长时间空白
  • 提交前确认正确的音频已经完成上传
2

开始音频转录

提交上传后的录音即可开始转写。您不需要准备原始文稿,也不需要手动输入录音中说了什么。工具会自动处理语音内容并生成文字。处理时间和转写效果会受到音频时长、录音清晰度、背景噪声、口音、语速以及多人语音重叠程度等因素影响。

3

查看、复制并导出转写结果

转写完成后,打开结果即可结合原始音频查看文字。当时间信息可用时,播放过程中会突出显示对应文字,也可以直接跳转到录音中的指定位置。支持导出 TXT 用于笔记和文字编辑、JSON 用于保留结构化数据、SRT 用于视频剪辑软件和播放器,以及 VTT 用于网站和兼容的网页播放器。如果文字仍需校对,可以复制或导出结果,再使用常用的文字编辑器或字幕编辑器进行最终修改。

音频转文字适合哪些场景

Dia TTS 可以帮助创作者、团队、教育工作者和研究人员,将已获授权的音频录音转换为便于后续使用的文字和字幕文件。

🎧

播客与访谈

将播客节目、采访和嘉宾对话转换为文字。当转写结果包含说话人信息时,可以区分不同说话人的发言,使对话内容更容易阅读。

📝

会议、课程与语音笔记

将已经录制好的会议、课程、演讲和语音笔记转换为便于查看和搜索的文字。当前工具处理的是上传录音,不直接加入实时会议,也不提供麦克风听写。

🎬

字幕与内容制作

将音频导出为 SRT 或 VTT,为字幕、节目说明、文章和短内容制作提供基础材料。如果原始素材是视频,需要先提取视频中的音频,因为当前页面只接受音频文件。

🔎

研究与资料整理

转写研究访谈、用户反馈、客服录音和其他已获授权的音频。可以导出纯文字用于阅读,也可以保留结构化 JSON 或带时间信息的字幕文件用于后续处理。

常见问题

体验 Dia TTS 语音转文字

上传音频、生成转写内容,并根据工作流程导出合适的文件格式。

注册后即可获得试用积分,无需安装音频转录软件。