R2T2 – 网易有道开源的低延迟真流式语音识别模型

Al项目 2026-09-28 17:46:24 AI导航网

R2T2是什么

R2T2是网易有道开源的低延迟真流式语音识别模型,全称Real Real-Time Transcription,基于Qwen3-ASR构建。R2T2采用append-only机制,已上屏文本不回改,支持80ms—2s可调分块、中英优化与热词上下文,平均延迟约200—600ms,提供vLLM、Transformers、llama.cpp/GGUF等后端,适合实时字幕、语音Agent和同传前端。

R2T2的主要功能

  • 真流式识别:按 80ms–2s 可调 chunk 持续进音频、持续出文字。

  • 落子无悔:已提交文本不回改,避免字幕闪烁和 Agent 动作被改写。

  • 低延迟高准确:官方口径平均延迟约 200–600ms,流式精度接近离线识别。

  • 热词/上下文:支持提示词、领域词、专名等先验,提高生僻词命中率。

  • 多语言:优化中英,同时保留法德意日韩俄西阿等跨语言能力。

  • 多后端部署:支持 vLLM、Transformers、llama.cpp/GGUF,并可起 WebSocket 服务。

R2T2的技术原理

  • 模型底座:R2T2 基于 Qwen3-ASR,继承其音频编码与序列建模能力,针对流式输出做约束训练。

  • 稳定前缀学习:训练时用 stable-prefix、强制时间对齐、token 级音频切分等数据构造,让模型学会判断“哪些前缀已经足够稳定可以外发”。

  • Commit/Wait 解码:每来一小段音频,模型先评估当前稳定前缀;够稳就 commit 成不可改文本,不够稳就 wait 继续缓存更多上下文。

  • 上下文条件生成:只把稳定前缀作为后续预测条件,既给足语义约束,又保证历史输出不被后续音频翻盘。

  • 延迟—精度调节:通过 chunk 大小、尾部长度/回退窗口等参数控制吞吐、延迟与容错,小 chunk 更快但更冒险,大 chunk 更稳但更慢。

微信关注回复“开源”,加入AI开源项目交流群

如何使用R2T2

  • 克隆仓库:git clone https://github.com/netease-youdao/Confucius4-R2T2.git。

  • 建隔离环境:用 Conda 或 uv 创建 Python 3.12 环境并 pip install -e .,或直接用官方 qwenllm/qwen3-asr Docker。

  • 下载权重:按后端选择 HF/ModelScope 的 Confucius4-R2T2 或 Confucius4-R2T2-GGUF。

  • 先跑离线/流式示例:./run_example.sh audio.wav --model_path ... --infer_mode stream_vllm --language Chinese --chunk_size_ms 160。

  • 写流式代码:加载 R2T2ASRModel.LLM,init_streaming_state() 后按 16kHz chunk 循环调 streaming_transcribe(),最后 finish_streaming_transcribe()。

  • 要 CPU/llama.cpp 部署:用 r2t2_llama 的 stream_llama_hybrid 或 stream_llama/onetime_llama 模式。

  • 起实时服务:用 ./run_start_server.sh start --model_path ... --vad_model_path checkpoints/vad/Stream-VAD --port 8272 --gpu 0。

  • 接客户端:向 ws://localhost:8272/asr_stream_api_v1 发送 16kHz mono int16 PCM,结束发送 YOUDAO_ONETIME_ASR_STREAM_EOS。

  • 调体验参数:用 language、chunk_size_ms、context/hotword、unfixed_token_num 在延迟、准确率和术语命中间取舍。

R2T2的核心优势

  • 真流式且不回改:已输出文本像“落子无悔”,避免字幕闪烁和 Agent 误执行。

  • 低延迟:官方口径平均约 200–600ms,适合实时字幕、同传和语音 Agent。

  • 延迟/精度可调:支持 80ms–2s 分块,按场景在更快与更稳之间切换。

  • 离线能力不弱:加流式约束不明显牺牲离线识别精度,可一套模型兼顾两类任务。

  • 底座与生态强:基于 Qwen3-ASR,开源后快速出现 GGUF、llama.cpp、Core ML、离线工具适配。

  • 工程化友好:提供 vLLM、Transformers、llama.cpp 后端和 WebSocket 服务,便于接入生产。

  • 可控输入先验:支持上下文/热词提示,提升人名、产品名、术语识别率。

  • 多语言覆盖:优化中英,同时保留多种跨语言流式识别能力。

R2T2的项目官网

  • 项目官网:https://r2t2.ai/
  • GitHub仓库:https://github.com/netease-youdao/Confucius4-R2T2
  • HuggingFace模型库:https://huggingface.co/netease-youdao/Confucius4-R2T2

R2T2的同类竞品对比

维度R2T2GPT-Realtime-Whisper
产品性质有道开源真流式 ASR,可私有化/二次开发OpenAI 托管流式 STT API,走 Realtime/ transcription session 体系
核心卖点append-only“落子无悔”,已出文本不回改边说边出字,强调低延迟转写和 API 集成
延迟口径官方称平均约 200–600ms,80ms–2s chunk 可调第三方实测约 TTFS p50 556ms、TTFT p50 1838ms;口径与 R2T2 不完全可比
精度参考README 给中英文多测试集流式/离线结果,需按业务复现第三方样本均值 WER 5.1%,但分布长尾明显,也要按语种复现
可控性代码 Apache-2.0、权重另有协议;支持热词/上下文/WebSocket闭源 API;可控点主要在 session 配置、音频参数与后处理
生态部署vLLM/HF/llama.cpp/GGUF/WebSocket,社区量化与离线工具多与 OpenAI Realtime 生态、transcription session、云方言集成更顺

R2T2的应用场景

  • 实时会议字幕:边发言边出定稿字幕,减少字幕回改造成的阅读干扰。

  • Voice Agent 指令入口:把“转账三百改三千”这类改口语句稳定识别,降低 Agent 误执行风险。

  • 车载/智能硬件语音交互:在低延迟约束下输出不可撤回的指令文本,适合导航、电话、车控场景。

  • 呼叫中心实时辅助:边说边转写并推送给坐席提示,兼顾延迟、术语热词与私有化合规。

  • 课堂/无障碍听写:为听力受损者或笔记场景提供稳定逐字流,减少闪烁和事后修订成本。

© 版权声明

相关文章