它这个能不能使用 llama 点 cpp 去运行啊?意思就是说它的这个模型是不是我还是需要去,就是 GGUF 这个格式要自己去转换。模型有多大?需要多大的显存呢?
FunASR与豆包ASR对比及免费性、性能分析
导出时间:2026/5/31 22:02:37
来源地址:https://www.doubao.com/chat/38428534519290114
消息数量:6
搜索 3 个关键词,参考 17 篇资料
先给你最关键结论:
1. FunASR 能不能用 llama.cpp 跑?
不能原生用 llama.cpp 跑。
原因:
- llama.cpp 只支持大语言模型(LLM):Llama、Mistral、Qwen 这类文本生成模型,格式是 GGUF。
- FunASR 是语音识别(ASR)模型:输入是音频,不是文本,结构是 Paraformer / SenseVoice,不是 LLM 结构。
- 两者网络结构完全不一样:一个处理语音时序,一个处理文本 token,不能互相直接跑。
网上有少数人把 Fun-ASR-Nano 转成 GGUF 塞进自家推理框架(不是标准 llama.cpp),属于魔改、非官方、不稳定,不推荐日常用。
2. 模型格式:要不要自己转 GGUF?
正常用 FunASR:不需要 GGUF,也不能用 GGUF。
- 官方原生格式:PyTorch(.bin/.pt)、ONNX
- 你直接
pip install funasr,它会自动下载官方模型,不用你转格式。 - 如果你硬要 GGUF:
- 没有官方转换脚本
- 只能用第三方小工具转(实验性质)
- 转完不能用原版 llama.cpp 加载
结论:想正经用 FunASR,别碰 GGUF。
3. 模型有多大?显存要多少?
下面是最常用几个官方模型(2026-05 最新):
(1)SenseVoiceSmall(推荐个人 / 低配)
- 大小:~80MB(参数),下载文件~200MB
- GPU 显存:FP16 ≈ 1.5GB;INT8 量化 ≈ 0.8GB
- 特点:最快、中文准、支持多语言 / 方言,4GB 显存显卡随便跑
(2)Paraformer-Large(高精度)
- 大小:~500MB,下载~1GB
- GPU 显存:FP16 ≈ 5.8GB;INT8 ≈ 3GB
- 特点:中文最准、远场 / 噪声强,6GB 显存起步
(3)Fun-ASR-Nano-2512(轻量全能)
- 大小:251MB
- GPU 显存:FP16 ≈ 4GB
- 特点:31 语言、带 VAD / 标点,RTX 3060/4050 无压力
(4)CPU 情况
- SenseVoiceSmall:内存 ≈ 1.2GB,速度 RTF ≈ 0.1(10 秒音频 1 秒多)
- Paraformer-Large:内存 ≈ 3GB,慢很多
4. 你实际怎么跑最省事?
直接用官方 Python 包,不用转格式、不用 GGUF、不用 llama.cpp:
bash
运行
pip install funasr
python
运行
from funasr import AutoModel
# 轻量推荐:SenseVoiceSmall
model=AutoModel(model="iic/SenseVoiceSmall", device="cuda") # GPU
# model=AutoModel(model="iic/SenseVoiceSmall", device="cpu") # CPU
res=model.generate(input="test.wav")
print(res[0]["text"])
- 自动下载模型,一行代码推理
- 4GB 显存就能流畅跑最好用的小模型
5. 一句话总结
- FunASR ≠ LLM:不能用 llama.cpp 跑,不需要 GGUF。
- 格式:官方 PyTorch/ONNX,自动下载,开箱即用。
- 大小 / 显存:
- 轻量:80MB / 1.5GB 显存
- 高精度:500MB / 5.8GB 显存
- 推荐:个人用 SenseVoiceSmall,4GB 显存足够,中文速度 / 准确率都很强。
如果你愿意,我可以给你写一个一键安装 + 测试脚本,直接复制就能跑,帮你避开所有坑。你要吗?
这个输入格式 MP3 行不行?还是说我要 FFmpeg 这个转成 WAV 格式才行啊?它输出是什么样的格式呢?有没有断句啊?标点这些
搜索 2 个关键词,参考 12 篇资料
直接说重点:MP3 可以直接用,不用手动转 WAV;输出默认可带断句和标点。下面拆开讲。
一、输入:MP3 行不行?要不要自己转 WAV?
✅ MP3 直接支持,不用你手动转。
- FunASR 从 2.0 开始内置 FFmpeg
- 你传:
.mp3/.m4a/.flac/.wav都能直接识别 - 内部会自动解码、重采样到 16kHz 单声道,不用你管
推荐:
- 日常:MP3 直接用(微信 / 手机录音都是 MP3)
- 追求最高准确率:用 WAV 16kHz 16bit 单声道
一句话:
只要装了
ffmpeg(apt install ffmpeg 或 brew install ffmpeg),MP3 直接丢进去就能跑。二、输出格式、断句、标点
1)输出格式(三种)
- 纯文本:
今天天气不错我们去公园散步 - 带标点文本(推荐):
今天天气不错,我们去公园散步。 - JSON / SRT(带时间戳):可做字幕、剪辑
2)有没有断句和标点?
✅ 有,而且是自动语义断句 + 标点恢复。
- 内置 PUNC 标点模型
- 自动加:, 。 ? ! 、
- 按语义停顿断句,不是机械切
示例:
- 关标点:
你好我是张三今天我们来开会 - 开标点:
你好,我是张三。今天我们来开会。
3)怎么开启标点?
python
运行
model=AutoModel(
model="iic/SenseVoiceSmall",
device="cuda",
punc_model=True # 开启标点
)
三、FFmpeg 要不要装?
- Windows /macOS/ Linux 都建议装
- 不装:只能读 WAV
- 装了:MP3/M4A/FLAC 全支持
安装:
bash
运行
# Ubuntu/Debian
sudo apt install ffmpeg
# macOS
brew install ffmpeg
# Windows
choco install ffmpeg
四、给你一个可直接跑的 MP3 示例
python
运行
from funasr import AutoModel
# 加载模型并开启标点
model=AutoModel(
model="iic/SenseVoiceSmall",
device="cuda", # 有GPU就用cuda,没有就改"cpu"
punc_model=True
)
# 直接读 mp3
res=model.generate(input="你的录音.mp3")
# 输出带标点结果
print(res[0]["text"])
小结
- MP3:直接支持,不用转 WAV(前提装 ffmpeg)
- 输出:默认可带断句 + 标点,很自然
- 显存:SenseVoiceSmall ≈ 1.5GB,4GB 卡随便跑
要不要我给你一段自动检测音频格式、自动补标点、导出 SRT 字幕的完整脚本?
我听说阿里巴巴新推出了一款 ASR 模型,据说比 Whisper 还要强很多倍。好像是叫 FUNASR 还是什么东西。反正相当的快,相当的好。我想了解一下,看它和这个豆包,就是火山引擎上面的这个语音识别到底相比怎么样?它是否是免费的?性能如何?
搜索 3 个关键词,参考 17 篇资料
先把结论说清楚:
- FunASR(阿里):本地部署完全免费、开源;中文速度 / 准确率强于 Whisper,方言和远场噪声尤其好。
- 豆包 ASR(火山 / 字节):云端 API 有免费额度、企业付费;综合体验强、稳定、售后好,但不能本地离线部署。
- 中文日常 / 本地隐私场景:选 FunASR;企业线上高可用 / 要售后:选豆包。
一、FunASR 是什么?
FunASR(Fundamental End-to-End Speech Recognition Toolkit),阿里达摩院 / 通义实验室开源的工业级语音识别工具包,最新版 FunASR 1.5(2026-05)。
- 核心:Paraformer/SenseVoice 非自回归模型,中文深度优化。
- 开源地址:GitHub,Apache 2.0 可商用。
二、是否免费?
- ✅ 本地部署:完全免费(模型、代码、无调用限制)。
- ✅ 个人 / 小团队:免费商用。
- ☁️ 阿里云 API:收费,0.00066 元 / 秒,无免费额度。
三、性能(vs Whisper)
中文场景(普通话 + 方言 + 噪声):
表格
| 指标 | FunASR-zh | Whisper-Large-v3 |
|---|---|---|
| 中文 CER(字错率) | 5.1% | 8.2% |
| 实时率(1 秒音频) | ≈0.006 秒(170 倍) | 慢 10–15 倍 |
| 显存占用 | 2.4GB | 5.8GB |
| 方言(粤 / 川等) | 优秀 | 一般 |
| 远场 / 嘈杂环境 | 强 | 一般 |
- 一句话:中文比 Whisper 快十几倍、更准、更小、方言更强。
四、FunASR vs 豆包(火山引擎 ASR)
1. 部署与费用
- FunASR:本地离线部署,永久免费、隐私可控;云端 API 收费。
- 豆包 ASR:纯云端 API,不能本地部署;个人有免费额度(注册认证即可用),企业按量付费。
2. 准确率与速度(中文)
- FunASR:中文 CER 5% 左右,方言 / 远场更强;本地最快、延迟最低(≈100ms)。
- 豆包 ASR:中文 CER 5%–6%,整体一流;云端稳定、并发强、售后好。
3. 功能差异
- FunASR:
- ✅ 本地离线、自定义热词、说话人分离、情绪识别。
- ✅ 支持 50 + 语言、七大方言、古诗词识别。
- 豆包 ASR:
- ✅ 双向流式、长音频(≤5 小时)、自动标点、数字规整。
- ✅ 多语种混合、垂直领域(医疗 / 教育 / 科技)优化。
五、怎么选?
- 👉 中文为主、本地离线、隐私优先、预算低:选 FunASR(免费、快、准、方言强)。
- 👉 企业线上、高并发、需售后、不想运维:选 豆包 ASR(稳定、免费额度、售后好)。
- 👉 多语种混合(英文为主):Whisper 仍有优势。
六、快速上手(FunASR)
bash
运行
pip install funasr
python
运行
from funasr import AutoModel
model=AutoModel(model="paraformer-zh") # 中文模型
res=model.generate(input="audio.wav") # 音频文件
print(res[0]["text"])
5 行代码即可本地转写,CPU 也能跑,GPU 更快。
要不要我给你一份 FunASR 本地部署 + 测试的极简脚本(含 CPU/GPU 版本和中文 / 方言模型一键下载)?