音频转文字

语音转文字

将会议、采访和播客等音频转写为文字稿,并导出 TXT 或 SRT。 基于 Whisper(Transformers.js / WASM)在浏览器的本地转写;音频不上传,首次需下载模型后即可离线复用。

正在加载语音转文字工具…

音频转文字适合做什么?

音频转文字适合整理会议、采访、课程、语音备忘和播客。工具使用 Transformers.js 在浏览器中运行 Whisper 语音识别模型,并可将识别结果导出为 TXT 文稿或带时间信息的 SRT 字幕。

音频内容不会上传到 The Browser AI 服务器。首次转写需要从 CDN 下载模型文件,后续可由浏览器缓存复用。识别速度和准确率会受到录音清晰度、背景噪声、语言、音频长度以及设备算力影响;较长文件会占用更多内存并需要更长时间。

支持格式:MP3, WAV, M4A, WebM;单个文件限制:浏览器可用内存范围内。

如何使用音频转文字

  1. 步骤 1

    上传或录制音频

    选择常见音频、视频文件,或允许麦克风权限后直接录制。

  2. 步骤 2

    运行本地转写

    选择识别语言并开始转写;首次使用会下载并缓存 Whisper 模型。

  3. 步骤 3

    校对并导出

    检查识别文本和时间轴,根据用途导出 TXT 或 SRT。

常见问题

音频转文字需要上传录音吗?

不需要。音频解码和 Whisper 推理均在浏览器本地运行;网络连接主要用于首次下载语音模型和相关运行文件。

为什么第一次转写比较慢?

浏览器首次使用时需要下载模型,随后还要根据设备性能完成本地推理。模型缓存可减少之后重复使用时的下载等待。

怎样提高语音识别准确率?

优先使用人声清晰、背景噪声较少且音量稳定的录音,并选择正确语言。多人重叠说话、强噪声和专业术语可能增加识别错误。

技术与资料来源

  • Transformers.js 在浏览器中运行机器学习模型的官方文档。
  • Whisper 本地语音识别所使用模型架构的开源项目。