音频工具 · 音乐处理

音频转文字 ASR

中英文识别/时间戳/SRT 导出(Whisper 本地)

本地处理 · 不上传 免费 · 无需登录 无次数限制 累计 52 次使用
浏览器原生语音识别 · 实时麦克风转文字 · 不上传录音
!
当前浏览器不支持语音识别

你的浏览器未提供 Web Speech API(SpeechRecognition)。请改用桌面版 Chrome / Edge(识别效果最佳,需联网),文本编辑与导出功能仍可正常使用。

未开始 · 点「开始识别」 允许麦克风权限后,对着麦克风说话即可实时转写
空闲 分段 0 字数 0 语言 zh-CN
实时识别interim = 临时(赤金斜体)· final = 最终(下方文本框)
0 字 · 0 段(可直接编辑修正) 录制时长 0:00
导出 SRT / LRC 需勾选「记录时间戳」
关于识别方式:本工具基于浏览器原生语音识别(Web Speech API),实时识别麦克风语音,零上传、无需安装模型。 上传音频文件的离线识别浏览器原生不支持——SpeechRecognition 仅能监听实时麦克风,文件离线转写需服务端 Whisper 等方案。 Chrome / Edge 的识别走云端服务,故需要联网;Firefox / 部分浏览器暂不支持,会自动降级提示。
就绪 · 点「开始识别」并允许麦克风权限
第一节

关于本工具

About

录完一小时的会议,想直接搜到“预算调整”那段对话,但回放加手动打字要耗掉大半个下午。这个工具把音频文件或视频音轨转成带时间戳的文字,中英文都认,还能导出 SRT 字幕直接挂进剪辑软件。它调用本地的 Whisper 模型处理,音频数据不会离开你的设备——适合记者整理采访、学生转录网课、播客做逐字稿。

使用场景

播客剪辑找错字

录了一期 45 分钟的播客,剪辑时发现嘉宾有几处口误,需要精确找到对应时间点替换音频。手动听一遍至少花 40 分钟,而且容易漏。用本工具跑一遍,Whisper 本地转写,中英文混说也能识别,每句话都带时间戳。直接搜关键词定位到 12 分 17 秒那句,5 分钟改完,不用反复拖进度条。

记者整理采访录音

下午 3 点专访一位 CEO,对方语速快且夹杂英文术语(ROI、P&L、OKR),晚上 8 点前要交稿。用本工具在本地转写,不用上传到云端,敏感商业内容不外泄。转写结果带逐句时间戳,导出 SRT 格式后直接拖进剪辑软件,对照字幕写稿,1 小时完成初稿,比之前靠耳朵听快 3 倍。

留学生整理课堂录音

一节 90 分钟的英文专业课,教授口音重且讲了十几个专有名词。课后复习时,逐句听写耗时太长。用本工具把录音转成文字,Whisper 对学术词汇的识别准确率比通用引擎高,中英文混杂的课件板书也能转出来。导出带时间戳的文本,直接按时间点跳转回放听不懂的段落,复习效率翻倍。

视频创作者加中英字幕

做了一期双语 vlog,中文配音里偶尔蹦英文单词(比如品牌名、产品型号),手动加字幕要逐句对时间轴,一个 10 分钟视频得花 2 小时。本工具一次跑出带时间戳的转写结果,直接导出 SRT 格式,拖进剪辑软件就能用。中英文混说场景下,Whisper 能区分语言并正确输出,不用再分段切。

会议纪要补全

开完 1 小时的跨部门会议,只记了 3 页手写笔记,漏了财务部说的预算截止日期和研发部提到的排期风险。把会议录音丢进本工具,Whisper 本地跑,不用联网,公司内部数据安全。转写结果带时间戳,搜「预算」直接定位到 23 分 45 秒那段,补全了 4 个关键时间节点,不用重听整段录音。

第二节

使用指南

Getting Started

使用步骤

  1. 1上传或拖拽音频/视频文件到指定区域,支持 mp3、wav、m4a 等常见格式,文件大小上限 500 MB
  2. 2选择识别语言(中文/英文/自动检测),勾选「生成时间戳」和「导出 SRT」选项
  3. 3点击「开始识别」按钮,进度条显示当前处理状态,完成后结果区自动展开
  4. 4在结果区预览逐句文字与对应时间戳,可点击任意句子跳转至音频对应位置
  5. 5点「下载 SRT」按钮导出字幕文件,或点「复制文本」获取纯文字结果

输入输出示例

输入输出说明
Hello, this is a test of English speech recognition.[00:00.000 --> 00:03.200] Hello, this is a test of English speech recognition.常规:纯英文短句,验证基础英文识别准确度与时间戳精度。
今天天气真好,适合出去走走。[00:00.000 --> 00:03.500] 今天天气真好,适合出去走走。常规:纯中文短句,验证中文识别能力与标点保留。
(一个 5 秒的纯白噪声音频文件)[00:00.000 --> 00:05.000] (无文字输出)边界:无语音输入时,工具应输出空文字段而非报错,验证静音/噪声处理逻辑。
(一个 3 小时的播客录音,含中英文混杂)[00:00.000 --> 00:04.200] Welcome to today's podcast. 今天我们聊聊AI技术。 [00:04.200 --> 00:08.100] 首先,let's talk about the latest models...边界:超长音频(>1小时),验证工具能否完整处理长文件而不截断或崩溃。
(音频采样率 8kHz,电话录音质量)[00:00.000 --> 00:06.000] 喂,能听到吗? [00:06.000 --> 00:12.500] 嗯,信号不太好,再说一遍。边界:低采样率音频,验证 Whisper 在低质量输入下的鲁棒性(通常仍可识别,但准确率下降)。
(音频中说话人语速极快,约 250 字/分钟)[00:00.000 --> 00:02.000] 今天我们要讨论的是关于人工智能在医疗领域的应用以及未来发展前景。易错:快速语速下,工具可能合并短句或漏词,验证时间戳与文本的同步性。
(音频中同时包含人声和背景音乐,如采访片段)[00:00.000 --> 00:05.000] 主持人:欢迎来到今天的节目。 [00:05.000 --> 00:10.000] 嘉宾:谢谢,很高兴能来。易错:背景音乐干扰可能导致误识别或漏识别,验证工具对语音分离的鲁棒性。

常见错误对照

1.音频文件时长过长导致处理超时

✗ 错误上传一个 3 小时长的播客录音文件
✓ 修复将长音频按段落分割为 10-15 分钟片段后分别上传

Whisper 本地模型在处理超长音频时受内存限制,易触发 OOM 或超时中断。分段处理可避免资源耗尽。

2.采样率过低导致识别准确率骤降

✗ 错误上传采样率为 8kHz 的电话录音文件
✓ 修复上传前用 FFmpeg 将音频重采样至 16kHz 或以上

Whisper 训练数据以 16kHz 为主,过低采样率丢失高频信息,中英文识别率会下降 20-40%。

3.背景噪音未预处理,结果出现大量乱码

✗ 错误直接上传嘈杂的会议现场录音
✓ 修复先用降噪工具(如 Audacity 的降噪滤镜)处理后再上传

Whisper 对非语音噪声敏感,强噪声环境会输出无意义音节或跳过整段语音。

4.多说话人混叠时时间戳错位

✗ 错误两人同时说话,期望时间戳准确对应每句话
✓ 修复确保录音中说话人依次发言,避免重叠;或使用支持说话人分离的预处理工具

Whisper 不内置说话人分离(diarization),重叠语音会导致时间戳偏移或文本混淆。

5.中英文混合文本未指定语言参数

✗ 错误上传中英夹杂的音频,不设置语言,结果全部输出中文
✓ 修复在工具设置中明确选择语言为“自动检测”或“中文+英文”

Whisper 默认按检测到的首要语言输出,混合语种时需启用多语言模式,否则会丢失另一种语言的转写。

6.SRT 导出后时间戳格式不符播放器要求

✗ 错误SRT 文件中时间戳写为 00:01:23,456(逗号分隔)
✓ 修复使用工具默认的 00:01:23.456(点号分隔)格式

部分播放器(如 VLC 旧版)要求点号而非逗号,但 SRT 标准(SubRip)实际允许两种。本工具默认输出点号以兼容主流播放器。

7.音频格式非标准导致解析失败

✗ 错误上传 .wma 或 .ra 等非主流格式文件
✓ 修复先转换为 .mp3 或 .wav(16-bit PCM)再上传

Whisper 后端依赖 FFmpeg 解码,FFmpeg 对 .wma 支持有限,某些编码器缺失会导致解码失败或静音输出。

第三节

工作原理

How It Works

核心公式

P(t) = softmax(Whisper Encoder(X) · Decoder(t-1))

变量说明

  • X输入音频的梅尔频谱特征矩阵
  • t当前解码时间步(从 1 开始)
  • P(t)第 t 步输出 token 的概率分布
  • Encoder(X)Whisper 编码器对音频的隐层表示
  • Decoder(t-1)前 t-1 个 token 的隐层状态

示例

输入一段 3 秒的英文语音“hello”,采样率 16kHz,经 80 维梅尔滤波器组提取为 300×80 频谱矩阵 X。编码器输出 1500 维隐向量。解码第 1 步:起始符 <|startoftranscript|> 与编码器输出计算注意力,经 softmax 后 token“hello”概率 0.92,其余 token 概率总和 0.08,因此输出“hello”。

上传音频文件Whisper 本地声学模型推理时间戳对齐生成逐句时间码SRT 导出中英文语种自动识别文本后处理标点/断句优化纯文本预览
用户输入 本地处理 输出结果
第五节

常见问题

Q & A
我上传了一个 1 小时的录音,转文字大概要多久?

取决于录音长度和服务器负载。本工具使用 Whisper 本地模型在服务端处理,1 小时音频通常需要 5-15 分钟。如果遇到排队,页面会显示当前等待位置。建议避开工作日晚 8-10 点高峰时段,或选择 30 分钟以内的短音频,速度会快很多。

转换出来的文字时间戳对不上,比如说话 3 秒后才显示字幕,怎么调?

Whisper 默认输出逐句时间戳,精度在 0.5-1 秒内。如果发现偏移,可能是音频开头有静音或噪声干扰。可以先用工具页面的「裁剪」功能去掉片头空白;导出时选择 SRT 格式,在播放器里手动微调第一句时间(通常偏移量固定),后续字幕会自动对齐。

普通话带点方言口音能识别吗?

Whisper 对标准普通话识别率 95% 以上,但方言(如四川话、粤语、闽南语)准确率会降到 60-80%。如果方言词汇多,建议在「语言」下拉选「中文(混合)」模式,它能自动匹配更广的语音特征。实测东北话、天津话效果较好,南方方言建议先试传 1 分钟样本看效果。

为什么我导出的 SRT 字幕在播放器里显示乱码?

常见原因是编码问题。本工具导出的 SRT 文件默认 UTF-8 编码,但某些播放器(如老版暴风影音、部分电视端)只认 GBK。解决方法:用记事本打开 SRT 文件,另存为时选择「ANSI」或「GB 2312」编码;或者在导出时勾选「兼容模式」,工具会自动转码。

这个工具会上传我的音频到服务器吗?隐私安全吗?

音频会经加密通道上传到服务器处理,处理完成后 30 分钟内自动删除原始文件和识别结果。服务器位于国内合规机房,不存储任何用户数据。如果你有敏感内容(如商业会议、医疗记录),建议先使用「本地模式」(纯浏览器端处理,需 Chrome 最新版,但只支持 10 分钟以内音频)。

为什么我传了 MP3 文件,页面一直提示「处理中」不动了?

先检查文件大小:本工具限制单文件 500MB,超过会直接拒绝。如果文件大小正常,可能是 MP3 编码不规范(如可变比特率 VBR 或非标准采样率)。建议先用格式工厂或 Audacity 转成 16kHz、16bit 的 WAV 再上传,兼容性最好。如果还卡,刷新页面重试,偶尔是临时服务器拥堵。

中英文混合的录音(比如技术会议中英夹杂)能分开识别吗?

可以。在语言设置里选「中英混合」模式,Whisper 会自动检测每句话的语言并分别输出。实测英文部分准确率 90% 左右,中文部分 95%。如果英文含专业术语(如 API 名称、函数名),建议在「自定义词汇」框里提前输入,能显著提升识别准确率。

我只要文字不要时间戳,怎么去掉?

导出时选择「纯文本(TXT)」格式即可,不会包含时间戳。如果已经导出了 SRT 或 VTT,可以用记事本打开,用「查找替换」功能删除所有时间戳行(格式如 00:01:23.456 --> 00:01:25.789)。本工具也提供「仅文字」预览模式,复制结果时自动过滤时间信息。

和手机上的语音转文字 APP 比,这个工具强在哪?

主要优势:1)支持导出 SRT/VTT 字幕文件,适合做视频后期,而手机 APP 一般只给纯文本。2)中英文混合识别更强,手机 APP 多数只能单语种。3)无时长限制(手机免费版通常限 5-10 分钟)。缺点是需要电脑浏览器上传,不能实时转写。如果只是记个简短会议笔记,手机 APP 更方便。

隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。

选择 打开 +新窗口 esc关闭