尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Qwen3-ASR 方言识别实战:粤语、四川话等 22 种中文方言转写完整指南

发布时间:2026/9/27 7:51:45

资讯中心
01
ARTICLE

Qwen3-ASR 方言识别实战:粤语、四川话等 22 种中文方言转写完整指南

Qwen3-ASR 方言识别实战:粤语、四川话等 22 种中文方言转写完整指南
Qwen3-ASR 方言识别实战:粤语、四川话等 22 种中文方言转写完整指南【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASRQwen3-ASR 是阿里云 Qwen 团队开源的语音识别(ASR)模型系列,能一句话完成粤语、四川话等 22 种中文方言的语音转写,同时支持 30 种语言识别、歌唱语音识别和时间戳对齐。本文面向新手,带你从零完成环境安装、方言音频转写,再到时间戳、流式识别等进阶玩法。 为什么方言识别难?Qwen3-ASR 强在哪传统语音识别模型遇到方言时,准确率往往会断崖式下跌——粤语识别错误率动辄 20% 以上,四川话更难处理。Qwen3-ASR 基于通义千问 Qwen3-Omni 的基础音频理解能力,用大规模语音数据训练,主打**一个模型全包**:✅All-in-one:同一个模型同时做语言/方言识别 语音转写✅方言覆盖广:30 种语言 22 种中文方言 多国英语口音✅又快又稳:1.7B 版本在开源 ASR 模型中达到 SOTA,0.6B 版本在 128 并发下吞吐量可达 2000 倍✅能听歌:支持纯语音、歌声、带背景音乐(BGM)的歌曲转写✅流式/离线统一:单模型同时支持流式与离线推理,最长可转写 20 分钟音频️ 支持的 22 种中文方言完整清单以下是 Qwen3-ASR-1.7B / 0.6B 支持的 22 种中文方言(完整信息见 README.md):类别支持的方言 18 种省级方言安徽、东北、福建、甘肃、贵州、河北、河南、湖北、湖南、江西、宁夏、山东、陕西、山西、四川、天津、云南、浙江 粤语口音粤语(港式口音)、粤语(广式口音)️ 其他吴语/闽语吴语、闽南语此外还独立支持 30 种语言(含中文、英文、粤语 Cantonese、日文、韩文、阿拉伯文等)。也就是说,粤语既可以作为语言强制指定,也会作为两种口音被覆盖。 快速上手:3 步完成你的第一句方言转写第 1 步:安装环境推荐新建一个干净的 Python 3.12 环境,然后安装qwen-asr包:conda create -n qwen3-asr python3.12 -y conda activate qwen3-asr pip install -U qwen-asr 追求最高推理速度和流式识别,请安装 vLLM 后端:pip install -U qwen-asr[vllm]如果本地开发,可克隆仓库源码安装:git clone https://gitcode.com/gh_mirrors/qw/Qwen3-ASR,然后pip install -e .(详见 pyproject.toml)第 2 步:加载模型import torch from qwen_asr import Qwen3ASRModel model Qwen3ASRModel.from_pretrained( Qwen/Qwen3-ASR-1.7B, dtypetorch.bfloat16, device_mapcuda:0, )模型权重会根据模型名自动下载;国内网络建议用 ModelScope 手动下载到本地目录(命令见 README.md)。第 3 步:转写一段方言音频results model.transcribe(audiocantonese_sample.wav) # 本地路径 / URL / base64 均可 print(results[0].language) # 自动识别出的语言/方言 print(results[0].text) # 转写文本就这 3 步,一段粤语或四川话音频就能变成文字。更多输入形式(URL、base64、内存波形)可参考示例 examples/example_qwen3_asr_transformers.py。 如何指定方言:自动检测 vs 强制语言(重要技巧)新手最容易困惑的一点:能不能把四川话填进language参数?答案是:不能直接填。language参数只接受 30 种受支持的语言名(如Cantonese、Chinese),清单定义在 qwen_asr/inference/utils.py 的SUPPORTED_LANGUAGES中,省级方言(四川话、东北话等)并不在列。正确做法分两种场景:方言音频(如四川话):设languageNone,模型会自动检测并输出识别结果,方言转写能力由模型本身保障粤语:可以直接写languageCantonese强制指定,此时模型输出纯文本(跳过语言检测),速度更快、更稳定# 四川话:自动检测 model.transcribe(audiosichuan.wav, languageNone) # 粤语:强制指定 model.transcribe(audiocantonese.wav, languageCantonese)长音频也无需手动切分:模型会自动按低能量边界切块(默认最长 20 分钟),再无缝拼回完整文本。⏱️ 进阶:给方言转写添加时间戳做字幕、剪视频时,光有文字还不够,还需要每个字/词出现在第几秒。Qwen3-ASR 家族中的Qwen3-ForcedAligner-0.6B专门解决这个非自回归时间戳对齐问题,支持中文、粤语等 11 种语言,对最长 3 分钟语音输出任意粒度的时间戳,精度超越 WhisperX 等主流方案(详见 qwen_asr/inference/qwen3_forced_aligner.py)。用法只需在加载模型时多传两个参数:model Qwen3ASRModel.from_pretrained( Qwen/Qwen3-ASR-1.7B, dtypetorch.bfloat16, device_mapcuda:0, forced_alignerQwen/Qwen3-ForcedAligner-0.6B, forced_aligner_kwargsdict(dtypetorch.bfloat16, device_mapcuda:0), ) results model.transcribe(audiosichuan.wav, return_time_stampsTrue) print(results[0].time_stamps[0].text, results[0].time_stamps[0].start_time)直接调用强制对齐器(给定文本音频求时间戳)的完整示例见 examples/example_qwen3_forced_aligner.py。️ 免代码体验:一键启动本地 Web Demo不想写代码?安装后直接运行两条命令即可:# 普通识别 Web UI(上传方言音频,点一下出结果) qwen-asr-demo --asr-checkpoint Qwen/Qwen3-ASR-1.7B --backend transformers --cuda-visible-devices 0 --ip 0.0.0.0 --port 8000 # 流式识别 Web Demo(麦克风实时粤语/四川话转写,vLLM 后端) qwen-asr-demo-streaming --asr-model-path Qwen/Qwen3-ASR-1.7B --gpu-memory-utilization 0.9 --port 8000然后浏览器打开http://你的IP:8000。加上--aligner-checkpoint Qwen/Qwen3-ForcedAligner-0.6B还能在界面上看到时间戳。命令行参数逻辑可查阅 qwen_asr/cli/demo.py 与 qwen_asr/cli/demo_streaming.py。 方言识别效果:官方基准数据一览官方在公开数据集上对比了 GPT-4o-Transcribe、Gemini-2.5-Pro、Whisper-large-v3 等(完整表格见 README.md),方言相关结果(WER,越低越好):数据集方言类型Whisper-large-v3Qwen3-ASR-1.7BKeSpeech多地方言混合28.795.10Fleurs-yue粤语9.183.98CV-yue粤语16.237.57WenetSpeech-Yue粤语(短/长)32.26 / 46.645.82 / 8.85WenetSpeech-Chuan四川话(易/难)14.35 / 26.8011.99 / 21.63Dialog-Chinese Dialects(内部)22 种方言平均44.5515.94可以看到,在粤语和四川话上,Qwen3-ASR-1.7B 相对 Whisper 有数倍精度优势,在 22 种方言平均错误率上更是从 44.55% 降到 15.94%。 常见问题 FAQQ1:1.7B 和 0.6B 该选哪个?精度优先选 1.7B(SOTA 级);部署并发量大、追求吞吐量选 0.6B(128 并发下可达 2000 倍吞吐量),两者用法完全一致。Q2:支持什么音频格式?最长多长?本地路径、URL、base64、内存波形均可;采样率不限,内部自动重采样到 16kHz。单次最长 20 分钟,自动切块拼接;开时间戳时按 3 分钟一块处理。Q3:没有 GPU 能跑吗?模型默认面向 GPU(bfloat16 推理),显存紧张时可调小max_inference_batch_size;也可以安装 FlashAttention 2 进一步省显存,或使用官方 Docker 镜像(构建文件见 docker/Dockerfile-qwen3-asr-cu128)。Q4:识别效果想再优化,能微调吗?可以。项目内置 SFT 微调脚本,支持 JSONL 音频-文本对、多卡 torchrun 训练,详见 finetuning/README.md 与 finetuning/qwen3_asr_sft.py。Q5:流式识别有什么限制?流式推理目前仅支持 vLLM 后端,且不支持批量推理和时间戳输出(限制逻辑见 qwen_asr/inference/qwen3_asr.py 中init_streaming_state的说明)。 项目资料导航资料说明README.md官方说明:安装、部署、基准评测全在这examples/transformers / vLLM / 流式 / 强制对齐四类示例代码finetuning/微调教程与 SFT 脚本qwen_asr/inference/qwen3_asr.py统一推理封装(转写/流式/时间戳)qwen_asr/cli/Web Demo 与 vLLM 服务命令行入口assets/Qwen3_ASR.pdf技术报告 PDF,想了解模型架构必读⚡ 小结:Qwen3-ASR 用一个模型 两种后端 一个对齐器,把粤语、四川话等 22 种中文方言识别变成了三行代码的事——装包、加载、转写,方言字幕党可以冲了!【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。