R2T2是什么
R2T2是网易有道开源的低延迟真流式语音识别模型,全称Real Real-Time Transcription,基于Qwen3-ASR构建。R2T2采用append-only机制,已上屏文本不回改,支持80ms—2s可调分块、中英优化与热词上下文,平均延迟约200—600ms,提供vLLM、Transformers、llama.cpp/GGUF等后端,适合实时字幕、语音Agent和同传前端。

R2T2的主要功能
真流式识别:按 80ms–2s 可调 chunk 持续进音频、持续出文字。
落子无悔:已提交文本不回改,避免字幕闪烁和 Agent 动作被改写。
低延迟高准确:官方口径平均延迟约 200–600ms,流式精度接近离线识别。
热词/上下文:支持提示词、领域词、专名等先验,提高生僻词命中率。
多语言:优化中英,同时保留法德意日韩俄西阿等跨语言能力。
多后端部署:支持 vLLM、Transformers、llama.cpp/GGUF,并可起 WebSocket 服务。
R2T2的技术原理
模型底座:R2T2 基于 Qwen3-ASR,继承其音频编码与序列建模能力,针对流式输出做约束训练。
稳定前缀学习:训练时用 stable-prefix、强制时间对齐、token 级音频切分等数据构造,让模型学会判断“哪些前缀已经足够稳定可以外发”。
Commit/Wait 解码:每来一小段音频,模型先评估当前稳定前缀;够稳就 commit 成不可改文本,不够稳就 wait 继续缓存更多上下文。
上下文条件生成:只把稳定前缀作为后续预测条件,既给足语义约束,又保证历史输出不被后续音频翻盘。
延迟—精度调节:通过 chunk 大小、尾部长度/回退窗口等参数控制吞吐、延迟与容错,小 chunk 更快但更冒险,大 chunk 更稳但更慢。

微信关注回复“开源”,加入AI开源项目交流群
如何使用R2T2
克隆仓库:
git clone https://github.com/netease-youdao/Confucius4-R2T2.git。建隔离环境:用 Conda 或 uv 创建 Python 3.12 环境并
pip install -e .,或直接用官方qwenllm/qwen3-asrDocker。下载权重:按后端选择 HF/ModelScope 的
Confucius4-R2T2或Confucius4-R2T2-GGUF。先跑离线/流式示例:
./run_example.sh audio.wav --model_path ... --infer_mode stream_vllm --language Chinese --chunk_size_ms 160。写流式代码:加载
R2T2ASRModel.LLM,init_streaming_state()后按 16kHz chunk 循环调streaming_transcribe(),最后finish_streaming_transcribe()。要 CPU/llama.cpp 部署:用
r2t2_llama的stream_llama_hybrid或stream_llama/onetime_llama模式。起实时服务:用
./run_start_server.sh start --model_path ... --vad_model_path checkpoints/vad/Stream-VAD --port 8272 --gpu 0。接客户端:向
ws://localhost:8272/asr_stream_api_v1发送 16kHz mono int16 PCM,结束发送YOUDAO_ONETIME_ASR_STREAM_EOS。调体验参数:用
language、chunk_size_ms、context/hotword、unfixed_token_num在延迟、准确率和术语命中间取舍。
R2T2的核心优势
真流式且不回改:已输出文本像“落子无悔”,避免字幕闪烁和 Agent 误执行。
低延迟:官方口径平均约 200–600ms,适合实时字幕、同传和语音 Agent。
延迟/精度可调:支持 80ms–2s 分块,按场景在更快与更稳之间切换。
离线能力不弱:加流式约束不明显牺牲离线识别精度,可一套模型兼顾两类任务。
底座与生态强:基于 Qwen3-ASR,开源后快速出现 GGUF、llama.cpp、Core ML、离线工具适配。
工程化友好:提供 vLLM、Transformers、llama.cpp 后端和 WebSocket 服务,便于接入生产。
可控输入先验:支持上下文/热词提示,提升人名、产品名、术语识别率。
多语言覆盖:优化中英,同时保留多种跨语言流式识别能力。
R2T2的项目官网
- 项目官网:https://r2t2.ai/
- GitHub仓库:https://github.com/netease-youdao/Confucius4-R2T2
- HuggingFace模型库:https://huggingface.co/netease-youdao/Confucius4-R2T2
R2T2的同类竞品对比
| 维度 | R2T2 | GPT-Realtime-Whisper |
|---|---|---|
| 产品性质 | 有道开源真流式 ASR,可私有化/二次开发 | OpenAI 托管流式 STT API,走 Realtime/ transcription session 体系 |
| 核心卖点 | append-only“落子无悔”,已出文本不回改 | 边说边出字,强调低延迟转写和 API 集成 |
| 延迟口径 | 官方称平均约 200–600ms,80ms–2s chunk 可调 | 第三方实测约 TTFS p50 556ms、TTFT p50 1838ms;口径与 R2T2 不完全可比 |
| 精度参考 | README 给中英文多测试集流式/离线结果,需按业务复现 | 第三方样本均值 WER 5.1%,但分布长尾明显,也要按语种复现 |
| 可控性 | 代码 Apache-2.0、权重另有协议;支持热词/上下文/WebSocket | 闭源 API;可控点主要在 session 配置、音频参数与后处理 |
| 生态部署 | vLLM/HF/llama.cpp/GGUF/WebSocket,社区量化与离线工具多 | 与 OpenAI Realtime 生态、transcription session、云方言集成更顺 |
R2T2的应用场景
实时会议字幕:边发言边出定稿字幕,减少字幕回改造成的阅读干扰。
Voice Agent 指令入口:把“转账三百改三千”这类改口语句稳定识别,降低 Agent 误执行风险。
车载/智能硬件语音交互:在低延迟约束下输出不可撤回的指令文本,适合导航、电话、车控场景。
呼叫中心实时辅助:边说边转写并推送给坐席提示,兼顾延迟、术语热词与私有化合规。
课堂/无障碍听写:为听力受损者或笔记场景提供稳定逐字流,减少闪烁和事后修订成本。
