尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

MLX-Audio 快速上手指南:在 Apple Silicon 上本地跑通 TTS 与语音识别

发布时间:2026/9/20 10:52:51

资讯中心
01
ARTICLE

MLX-Audio 快速上手指南:在 Apple Silicon 上本地跑通 TTS 与语音识别

MLX-Audio 快速上手指南:在 Apple Silicon 上本地跑通 TTS 与语音识别
MLX-Audio 快速上手指南在 Apple Silicon 上本地跑通 TTS 与语音识别【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audioMLX-Audio 是基于 Apple MLX 框架的语音 AI 库集文本转语音TTS、语音转文本STT、语音增强与分离STS于一体专为 M 系列芯片优化。给想在 Mac 上做离线语音功能的开发者用卖点是一条命令就能在本地合成语音不用调云端 API。它替你省了什么写个会议纪要助手用云端 TTS/ASR 有两个绕不开的问题按字符计费、录音数据出本机。自研又得在 Mac 上折腾 PyTorch 部署各家的模型还得自己改推理路径。MLX-Audio 把这件事收敛成一个包TTS、STT、STS、VAD、音乐生成共用一套load / generate接口模型按 Hugging Face 仓库名直接加载底层走 MLX 的统一内存推理全程不离开你的 Mac。Python 3.10pip install mlx-audio即可。功能一眼看全能力一句话说明适用场景TTS 语音合成20 模型从 Kokoro-82M 到 KugelAudio-7B有声书、语音助手零样本语音克隆一段参考音频即可复刻音色OmniVoice、LongCat 等个性化语音STT 语音识别Whisper、Qwen3-ASR、Parakeet25 种欧洲语言等会议转写说话人分离 时间戳VibeVoice-ASR9B输出结构化 JSON支持 60 分钟长音频多人会议记录语音增强 / 分离MossFormer2 降噪、SAM-Audio 按文本提示抽声音录音修复、分轨流式推理STT/TTS 均支持 chunk 级输出低延迟实时字幕OpenAI 兼容 API/v1/audio/speech等标准端点现有服务直接对接量化转换3/4/6/8bit 及 mxfp4/mxfp8 模式压低内存占用5 分钟跑起来pip install mlx-audio mlx_audio.tts.generate \ --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \ --text Hello, world! --voice Vivian预期结果当前目录生成audio_000.wav加--play会直接播放。Python 里则是load_model(...)加model.generate(...)两步波形以mx.array返回。两个真实场景场景一会议录音转文字还要分清谁在说话问题一小时的多人会议要带时间戳和说话人标签的转写。做法加载 VibeVoice-ASR结果直接是结构化 JSON不用自己切段。from mlx_audio.stt.utils import load model load(mlx-community/VibeVoice-ASR-bf16) result model.generate(audiomeeting.wav, max_tokens8192, temperature0.0) for seg in result.segments: print(f[{seg[start_time]:.1f}s] 说话人{seg[speaker_id]}: {seg[text]})专业术语多时给generate传contextMLX, PyTorch, ...作热词提示效果会稳不少。场景二内存吃紧时怎么挑量化模型问题KugelAudio 是 7B 模型bfloat16 下需要约 17GB 内存16GB 的 Mac 直接放不下。做法用它自带的 convert 脚本压到 4bit权重体积约降 4 倍。python -m mlx_audio.convert \ --hf-path kugelaudio/kugelaudio-0-open \ --mlx-path ./kugelaudio-4bit \ --quantize --q-bits 4 --q-mode affine很多模型不用自己转Kokoro 提供 bf16/8bit/6bit/4bit 现成版本Voxtral Realtime 有 4bit 和 fp16 两档直接按名字加载。性能与内存怎么选按机器内存对号入座8GBKokoro-82M 这类小模型bf16 都装得下Qwen3-TTS-0.6B 选 8bit 版。16GB0.6B~1.7B 模型建议 4bit/8bit4B 模型Voxtral Realtime、Higgs Audio v3选 4bit别碰 7B bf16约 17GB。32GB4B 模型可用 bf16 换质量7B 模型用 4bit。量化模式选affine按位数的常规量化最通用mxfp4/mxfp8是 Apple Silicon 原生浮点格式。拿不准时记住一条先试 8bit精度损失基本不可闻内存还只有一半。踩坑与排查导 MP3 报错缺 ffmpegbrew install ffmpeg。WAV 输出不需要它。Kokoro 跑日语/中文报错需额外装misaki[ja]或misaki[zh]这是它的文本处理依赖。首次运行很慢模型在下载缓存之后走本地。Qwen3-TTS 的 Base 版为什么没有--voiceBase 模型无预置音色要用ref_audioref_text走克隆路径预置音色选 CustomVoice 版。4bit 和 fp16 差在哪4bit 显存/内存占用更小、通常也更快fp16 保真度上限更高实时场景优先 4bit。资料在哪模型清单与示例README.md每类模型的仓库名、语言支持都在表里TTS 模型实现、STT 模型实现、STS 语音处理量化与格式转换脚本mlx_audio/convert.py上手文档docs/getting-started/quickstart-python.md、安装说明每个模型目录下有自己的 README流式、对齐、热词等参数都写在里面写在最后MLX-Audio 的价值不在某个单点功能而在于它把模型下载 → 加载 → 生成 → 保存这条链路在 Apple Silicon 上做得足够短TTS、STT、STS 共用一套接口量化和 OpenAI 兼容 API 都内置好了。如果你的目标是在 Mac 上做离线语音功能从 Kokoro 或 Qwen3-TTS 的 8bit 版开始跑通第一段音频只要几分钟。【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。