
MLX-Audio在 M 系列芯片上本地跑语音合成的完整指南【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio想在 Mac 上本地生成语音又不想把文本发给云端MLX-Audio 就是为此准备的一个基于 Apple MLX 框架的文本转语音库专门针对 M 系列芯片优化把多语言合成、语音预设和 0.5 倍到 2.0 倍之间的语速调节全部放在本地完成。项目概览它替你解决了什么传统方案里本地合成意味着吃满 CPU、等待漫长云端方案则要权衡隐私与网络。MLX-Audio 的定位是在两者之间找了一条中间路推理任务交给 Apple Silicon 的硬件加速而不是 CPU 硬算速度比传统 CPU 实现快数倍。对你来说它解决的核心问题有三件事推理在 M 系列芯片上显著提速长文本合成不再干等英语、日语、中文等多语言支持开箱即用丰富的语音预设加上可自由调节的语速一套工具覆盖多数内容制作需求附带带 3D 音频可视化的 Web 界面不需要写代码也能试听效果。安装、快速开始这类细节都可以直接查阅 官方文档。快速上手从安装到第一条音频一条命令装好环境最简安装只需要一行pip install mlx-audio如果打算使用 Web 界面或 API 功能则需要装齐全部依赖pip install -r requirements.txt生成第一条音频的最快方式命令行是体验 MLX TTS 最快的入口。生成一条基础语音mlx_audio.tts.generate --text Hello, world想自定义输出文件名mlx_audio.tts.generate --text Hello, world --file_prefix hello想调整语速可取 0.5 到 2.0 之间的倍速值mlx_audio.tts.generate --text Hello, world --speed 1.4装好之后跑通上面任意一条命令本地文本转语音的最小闭环就完成了。在 Python 里调用集成到代码里也只需要几行from mlx_audio.tts.generate import generate_audio generate_audio( text欢迎使用MLX-Audio语音合成库, model_pathprince-canuma/Kokoro-82M, voiceaf_heart, speed1.2, file_prefixmy_audio, audio_formatwav )模型与语音选择Kokoro 与 CSM 怎么选两个主力模型的定位差别很清晰。Kokoro-82M走通用路线轻量、快速、多语言。语音代号的首字母对应语言——a美式英语b英式英语j日语先装pip install misaki[ja]z普通话先装pip install misaki[zh]csm-1b走对话路线来自 Sesame 项目特色是支持参考音频。给出一条参考声音样本合成结果的声音就会贴近这个样本适合需要对话感、连续语境的场景python -m mlx_audio.tts.generate --model mlx-community/csm-1b --text 你好来自Sesame。 --play --ref_audio ./conversational_a.wav一句话总结只要说得快、语言多就选 Kokoro要像某个声音、像对话就上 CSM 加参考音频。Web 界面与本地服务两条命令拉起前后端MLX-Audio 自带的 Web 界面覆盖这几类功能可定制参数的文本转语音生成、多语言语音转文本转录、音频文件上传与播放以及 3D 音频可视化。前端 UI 是一个独立的 Web 工程进入对应目录启动开发服务cd mlx_audio/ui npm run dev后端 API 服务由 Python 侧提供指定监听地址和端口mlx_audio.server --host 0.0.0.0 --port 9000两边就绪后浏览器访问http://127.0.0.1:8000即可在页面上直接体验完整功能。进阶玩法Swift 集成与模型量化把 TTS 装进原生 App如果目标是 macOS 或 iOS 原生应用Swift 包提供了设备端合成能力平台要求macOS14.0iOS16.0基本用法是创建会话、异步生成音频import MLXAudio // 创建会话并生成语音 let session try await MarvisSession(voice: .conversationalA) let result try await session.generate(for: 你的文本内容) print(生成了 \(result.sampleCount) 个样本 \(result.sampleRate) Hz)用量化给模型减重模型量化直接关系内存占用与生成吞吐在内存紧张的机型上尤其有用from mlx_audio.tts.utils import quantize_model, load_model model load_model(repo_idprince-canuma/Kokoro-82M) weights, config quantize_model(model, config, group_size64, bits8)上例中bits8指定 8 位精度group_size64是分组大小可按需调整。更多量化细节见 量化指南。实用建议内存吃紧时优先上量化模型是降低占用最直接的手段按项目需求在模型质量与生成速度之间做取舍不必一味追大模型有 M 系列芯片就用足它的硬件加速推理速度优势主要来自这里。常见落地方向快速把文稿变成有声读物为视频、播客加旁白或者给本地应用搭语音交互层。如果你手上正好有一台 M 系列芯片的 Mac最省事的验证路径是装好 MLX-Audio先用 Kokoro 跑通第一条命令行音频再把 Web 界面拉起来给团队试听。【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考