地址: 泉州市刊舌入口209号 邮箱: deposed@gmail.com 工作时间:上午9点-下午8点

新闻动态

  • 首页
  • Our Portfolio
  • 双榜第一!网易两款模型力压 OpenAI、谷歌,登顶Hugging Face

双榜第一!网易两款模型力压 OpenAI、谷歌,登顶Hugging Face

2026-10-01

网易在全球 AI 开源社区交出重磅成果。近日,网易有道开源的子曰 Live 系列两款模型 —— 真流式语音识别模型 Confucius4‑R2T2、流式翻译模型Confucius4‑T3PO,先后登顶全球 AI 开源社区 Hugging Face 语音识别(ASR)、机器翻译两大细分 Trending 热榜,实现国产实时 AI 模型 “双登顶”。 在两个榜单中,OpenAI Whisper、Google、Meta等全球科技公司的相关模型也同时在列。网易此次连续拿下两个细分榜第一,也让中国团队在实时语音AI方向受到全球开发者集中关注。 图注:语音识别Trending榜,R2T2登顶(左);翻译Trending榜,T3PO登顶(右) 双榜登顶:全球开发者深度参与模型适配 登顶之后,网易两款开源模型很快获得开发者社区进一步响应。截至9月30日,Hugging Face页面显示,R2T2主模型近30天下载量超过1万次,T3PO主模型超过1300次;据相关数据统计,R2T2、T3PO及其官方GGUF版本近30天累计下载量已超过3万次。 开源之后,全球开发者不再只是简单下载模型权重,而是投入力量开展工程化适配。R2T2发布后,Hugging Face 官方主动搭建ZeroGPU在线Demo,提供免费算力降低测试门槛。海外开发者在纯C++音频推理框架audio.cpp 完成原生适配,不仅重新实现了Longest Stable Prefix流式状态机和稳定文本提交机制,还加入GGUF、本地实时麦克风识别和Streaming API等能力。 图注:Hugging Face上的ZeroGPU在线Demo T3PO同样完成多档位GGUF量化适配,让140亿参数级实时翻译模型具备端侧部署条件。从在线体验、模型量化到原生Runtime适配,两款模型正在从Hugging Face上的开源模型,进一步进入开发者的实际开发工具链。 直击 Voice Agent 痛点:一套链路实现 “边说边听边译” 两款模型能够快速出圈,核心解决了实时语音交互领域两大技术难题。 R2T2 瞄准传统流式识别 “输出文字反复改写” 的行业顽疾。多数伪流式识别会随着后续音频修改已输出内容,普通字幕仅会出现文字闪烁,但对于需要执行指令的语音智能体,识别结果来回变动会造成大模型意图判断、工具调用出错。 依托最长稳定前缀机制,R2T2做到输出文本只增不改、落子无悔:模型判断音频信息足够可靠才提交结果,支持 80毫秒‑2 秒灵活流式输入。官方测试显示,R2T2 在保持接近离线 ASR 准确率的同时,平均识别延迟(平均说完每个字到识别出这个字的时间)约为 200 至 600 毫秒。 进一步的公开评测显示,在多个中英文测试集上,R2T2 相较 WhisperRT、Nemotron、Voxtral 等同类方案,在低延迟条件下保持了更优或具有竞争力的识别表现。这意味着,模型并非单纯追求 “更快出字”,而是在响应速度、识别准确率和输出稳定性之间取得平衡,也让下游大模型能够在用户尚未说完话时,提前获得稳定文本并开展后续处理。 图注:英文测试集质量和延迟结果对比

about image

订阅我们的时事通讯并获取最新消息