FunASR-nano-2512 + vLLM的AutoModelVLLM是否可以支持输出sentence_info句子级别的时间戳 #3513
|
FunASR-nano-2512 + vLLM的AutoModelVLLM是否可以支持输出sentence_info句子级别的时间戳,配置了vad_model、spk_model和sentence_timestamp=true仍只输出token字级别的时间戳 |
Replies: 1 comment 1 reply
|
结论:在当前 FunASR v1.4.3 / 原因是 如果当前业务必须使用稳定的句级时间戳/说话人输出,请先使用公开的 from funasr import AutoModel
model = AutoModel(
model="FunAudioLLM/Fun-ASR-Nano-2512",
vad_model="fsmn-vad",
punc_model="ct-punc",
spk_model="cam++",
device="cuda",
)
result = model.generate(
input="audio.wav",
sentence_timestamp=True,
return_spk_res=True,
)
print(result[0]["sentence_info"])源码中另外有 |
结论:在当前 FunASR v1.4.3 /
main中,AutoModelVLLM本身还不能通过vad_model、spk_model和sentence_timestamp=True组装sentence_info。你现在只拿到 token/字级timestamps是当前实现的预期结果,不是这些参数写错了。原因是
AutoModelVLLM当前直接包装FunASRNanoVLLM:后者的generate()只在 CTC 可用时添加timestamps,没有运行 VAD、CAM++ 或sentence_info后处理;上述额外参数被**kwargs接收,但不会启用这条组合 pipeline。如果当前业务必须使用稳定的句级时间戳/说话人输出,请先使用公开的
AutoModelpipeline:源…