CodeKitHub
日常工具

音频提取器

最后更新:

一个视频文件其实是两条独立的流合并在一起——视频帧和音轨——而只想取出音频通常意味着要安装桌面软件或将文件上传到服务器。本工具完全在你的浏览器中完成这一切:拖入一个视频,选择 MP3、WAV 或 AAC,它会使用 ffmpeg.wasm(编译为 WebAssembly 的完整 FFmpeg 多媒体工具套件)在你的设备本地提取音轨。任何内容都不会被上传到任何地方。

工具介绍

音频提取是指在不重新编码视频的情况下,从视频容器(如 MP4、MOV 或 WebM)中分离出音频流的过程——严格来说这是一个“解复用并转码音频”的操作,而不是对整个文件的转换。由于视频流和音频流在容器格式内部本来就是分开存储的,音轨可以被直接取出。

本工具使用 FFmpeg——支撑市面上大多数视频和音频软件的开源多媒体框架,通过 ffmpeg.wasm 项目 编译为 WebAssembly,因此它以 JavaScript 的形式在你的浏览器中运行,而无需服务器或原生安装。首次运行时,浏览器会下载约 30 MB 的 FFmpeg 引擎;之后,提取过程完全在你自己的设备上使用你自己的 CPU 完成。

由于没有上传步骤,也就没有服务器强加的文件大小限制,无需排队等待,也不存在你的视频去了哪里的隐私问题——这正是本站其他每一个客户端工具能够如此运作的共同特性。

为什么使用它?

  • 刚开完一场腾讯会议或飞书视频会议,只想要录音去做会议纪要转写——把 MP4 拖进来选 MP3,不用为两分钟的事专门打开剪辑软件。
  • 用手机拍了一段弹吉他的视频(因为当时只有相机是开着的),现在想把音频导入编曲软件继续混音,选 WAV 就不会因为转码而损失音质。
  • 客户发来一条几百兆的产品演示视频,你只需要把口播提取出来发到小红书或播客账号——不用为了这一次提取去装 PR 或者剪映的插件。
  • 整理老家庭录像时,想给里面的解说音轨留一份轻量的 AAC 备份,而不是把每个几个 G 的视频都原封不动地存着。
  • 在公司电脑或公用设备上没有安装权限,但开会前又急需从一段屏幕录制里取出音轨。
  • 视频里是客户电话或还没发布的demo曲目,处理全部在本地完成,文件不会为了提取一段声音就被传到服务器上。

使用方法

  1. 点击拖放区域(或直接拖放文件)从设备中选择一个视频文件。
  2. 选择输出格式:MP3(体积小,兼容性广)、WAV(无压缩,最适合进一步剪辑)或 AAC/M4A(高效,适配 Apple 生态)。
  3. 点击“Extract audio”——首次运行会下载约 30 MB 的提取引擎,之后处理将在本地进行。
  4. 使用内置的音频播放器预览结果,然后点击“Download”保存文件。

示例

输入

一段带有旁白的 5 分钟 MP4 屏幕录制

输出

narration.mp3(仅音频,时长相同,无视频轨道)

输出音频的时长始终与源视频完全一致,因为提取过程不会做任何裁剪或调整时间的操作——它只是移除视频流,并将现有音频编码为所选格式。

MP3 与 WAV 与 AAC——如何选择

合适的输出格式取决于你接下来要如何使用这段音频。

格式文件大小最适合
MP3最小播客、语音备忘录、分享、常规播放
WAV最大(无压缩)进一步音频剪辑、混音、母带处理——无质量损失累积
AAC / M4A小巧高效Apple 设备/应用,体积小但质量好

为什么提取音频比完整转换视频快得多

由于音频流和视频流在 MP4、WebM 这类容器内部本来就是分开存储的,提取只需要对容器做解复用,并对音频流做转码——视频画面完全不会被解码或重新编码。这就是为什么从一个 500 MB 的视频里提取音频,通常只需要完整视频转换所花时间的一小部分。

  • 不解码视频:工具跳过逐帧读取和渲染的步骤,因为只处理音频流。
  • 不重新编码视频:没有画面需要压缩或缩放,CPU 占用比视频转换工具低得多。
  • 输出体积相对源文件很小:一个 500 MB 视频的音轨通常只有几 MB 到几十 MB,具体取决于时长和格式。

相关工具

如需其他本地媒体处理,请尝试以下工具。

视频压缩(目标大小) · GIF 压缩 · 图片压缩

常见问题

这和转换视频文件是一回事吗?

并不完全是——视频转音频的“转换”通常意味着重新编码所有内容,而本工具专门是从视频容器中解复用(分离)出已有的音频流,并仅将该流编码为你选择的格式,不会触碰或重新渲染任何视频帧。

为什么第一次提取比之后的时间更长?

工具需要在你首次在某次浏览器会话中使用时下载 FFmpeg WebAssembly 引擎(约 30 MB)。首次加载完成后,该引擎会保留在内存中,之后的提取会立即开始。

我应该选择哪种格式——MP3、WAV 还是 AAC?

MP3 文件最小,随处可用,适合大多数场景,如播客或片段分享。WAV 是无压缩、无损的,如果你要将音频用于进一步剪辑(在这种情况下质量损失会不断累积),这一点很重要。AAC/M4A 是一个不错的折中选择,单位体积下质量较高,在 Apple 生态中尤为常见。

我可以使用哪些视频格式作为输入?

只要浏览器能读取其元数据且 FFmpeg 支持的格式都可以,基本涵盖所有常见格式:MP4、MOV、WebM、MKV、AVI 等。如果某个特定文件失败,可以尝试改用标准的 MP4 或 WebM 导出格式。

我的视频会被上传到服务器吗?

不会。视频文件永远不会离开你的设备——它被直接读入浏览器内存,并完全通过 WebAssembly 在客户端处理。只有一次性的 FFmpeg 引擎下载来自 CDN;你实际的视频和提取出的音频都不会。

对可以使用的视频大小或时长有限制吗?

工具本身没有硬性限制——由于一切都在本地处理,实际上限取决于你设备的内存和 CPU 性能。几个 G 或时长超过一小时的视频处理起来会明显更慢、占用更多内存,但不存在服务器端的上传上限问题。

提取出的音频相比视频原音轨会损失音质吗?

选择 WAV 会无损保留音频,除了源文件本身已有的质量外不会再有额外损失。MP3 和 AAC 会将音频重新编码为压缩格式,会带来一定程度的质量损失——在常见码率下通常听不出来,但如果之后要做进一步编辑或重度处理,差异会更明显。

如果视频有多条音轨(比如不同语言),可以提取指定的一条吗?

本工具提取的是视频的默认/主音轨。如果一个文件内嵌了多条音轨(部分 MKV 文件常见),工具不支持在多条音轨之间选择——这种情况需要先用专门的视频编辑软件选定音轨。

引擎加载完成后,处理视频还需要联网吗?

不需要。约 30 MB 的 FFmpeg 引擎在本次会话中下载完成后,提取过程完全离线运行——你可以断网继续使用。

相关工具