
①云知声今日公告,其U2-ASR语音识别与U2-TTS语音合成模型已完成多语种能力全面升级。其中,ASR模块新增支持13种国际语言识别,TTS模块新增8种东南亚语言合成。 ②全球低资源语言AI模型市场预计将从2025年的48.7亿美元增长至2033年的169.2亿美元。
《科创板日报》7月28日讯(记者 黄心怡)2026年的AI行业正处在一个关键的转折点上。行业焦点正从“谁更会聊天”转向“谁能把事干成”。语音AI赛道随之加速升温,更强的语音识别能力成为各大模型厂商的关注点。
云知声今日公告,其U2-ASR语音识别与U2-TTS语音合成模型已完成多语种能力全面升级。其中,ASR模块新增支持13种国际语言识别,TTS模块新增8种东南亚语言合成。至此,U2语音大模型已覆盖超过100种中国方言及15种以上国际语言,在语音大模型领域形成从本土方言到全球多语种的拓展。
在具体升级方面, U2-ASR进一步拓展统一多语种联合建模架构,新增支持:阿拉伯语、德语、西班牙语、法语、印尼语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、意大利语等13种国际语言。U2-TTS重点强化东南亚多语种语音合成能力,新增支持:泰语、越南语、印尼语、马来语、缅甸语、柬埔寨语、菲律宾语、老挝语等8种语言。
测试显示,U2-ASR在13种语言工业级测试集上的平均字错率(CER)低至6.58%,12种语言CER低于8%,德语、西班牙语、印尼语、意大利语、越南语等5个重点语种进入5%以内。
从行业视角看,全球AI语音技术资源长期集中于中文、英文等大语种,部分发展中国家及语言资源有限的市场,仍面临训练数据不足、模型建设成本高企、优质服务供给有限等制约。
行业研究机构Data Bridge Market Research的报告显示,全球低资源语言AI模型市场预计将从2025年的48.7亿美元增长至2033年的169.2亿美元。与此同时,中国AI企业出海对多语种语音基础设施的需求正在快速释放。云知声通过“一个模型、一套接口”降低多语种部署门槛,在技术供给与市场需求之间找到了一个相对清晰的切入点。
目前,完成升级的U2-ASR 与 U2-TTS 已全量上线云知声TokenHub大模型服务平台,并开放标准API,支持开发者与企业根据业务需求调用。
根据此前的业绩预告,云知声预计2026年上半年营收为5.3亿到5.8亿,较上年同期增长31%到43%。
分业务来看,依托大模型能力的智能体业务预计上半年实现收入5.15亿元至5.50亿元,较2025年同期增长200%至220%;
公司今年新拓展的大模型Token直接调用业务2026年上半年预计收入约3000万元,毛利率不低于60%,其中2026年第二季度Token调用收入约2500万元,相较2026年第一季度环比增长约500%。
值得关注的是,语音大模型赛道的竞争正在升温。头部厂商纷纷押注语音大模型。7月20日,字节跳动Seed团队正式发布音频创作模型Seed Audio 1.0。同日,阿里千问推出语音合成大模型Qwen-Audio-3.0-TTS。此外,OpenAI在今年陆续推出GPT-Live和GPT-Realtime-2。Google、微软等全球巨头也在加码布局。
云知声在多语种和方言上的差异化优势,能否在巨头的挤压下持续转化为商业壁垒,仍是一个开放性问题。从业绩数据来看,云知声从技术到商业的转化正在加速,但仍面临激烈的行业竞争、持续的亏损压力。
正如云知声创始人黄伟所言,2023年至2025年是大模型发展的“热身赛”,2026年才进入真正竞争阶段。不同AGI路线最终都需要回答同一个问题:技术能力如何转化为商业回报。能否在持续烧钱与自我造血之间找到可持续的平衡点,这既是云知声的命题,也是整个AI行业正在面对的集体考题。