精通
英语
和
开源
,
擅长
开发
与
培训
,
胸怀四海
第一信赖

锐英源精品原创,禁止全文或局部转载,禁止任何形式的非法使用,侵权必究。
锐英源软件在语音识别技术上有一定的成果,看到OpenCV邮件列表里对Smallest.ai公司Hydra语音AI产品的介绍,非常有启发意义,就进行了相关内容总结。
总结收获:
1、常见的语音AI有语音输入法、小艺等语音导航、Siri、语音AI获客一体机、语音AI客服、农业场景的动物声音分析、工业场景里的异常声纹识别和会议记录语音AI,如果想找语音AI方面的FDE前沿部署工程师岗位工作,这些应用场景的要点和背后技术要多关注。
2、虽然现在有各种种样的语音AI和语音识别产品,但是在更复杂场景下更准确更快速地进行互动依然是难题,所以Smallest.ai有技术特色,就赢取了融资成功。
3、语音AI在发展,其实语音和视频视觉的重要性层次一致,最近还有家国内公司在招聘语音技术人才,这家公司经过了几轮融资,现在是求贤若渴。所以说AI需要高端的软件开发人才,掌握语音各方面的标准,从简单的pcm和复杂的压缩格式,掌握语音的常用软件和平台,都有利于找到语音AI方面的工作。锐英源软件能够帮助大家学习,欢迎关注。

多数生成式语音智能体都需要将来电者的音频依次传入多个组件处理:语音识别模块输出文本,大语言模型生成应答内容,文本转语音模型输出最终语音响应,后续编排软件、内存模块与安全控制机制还会叠加更多处理步骤。每一次模块之间的转交,都会引入新的延迟来源、额外成本以及故障可能性。 在用语音方式和DeepSeek、豆包、混元、文心等大模型交互时,通常就是这样的流程,因为是一问一答,场景不复杂,也不需要特别的技术。
Smallest.ai将这套自研的替代方案称为“Voice 4.0”,这一命名是其对一款异步架构推出的营销称谓,该架构可以同步处理监听、推理、指令执行与响应生成全流程。这套架构的核心产品名为Hydra,是一款全双工端到端语音转语音模型,仅通过一条WebSocket连接就可完成麦克风音频接收,同时流式传回生成的语音内容。
Hydra摒弃了“自动语音识别→大语言模型→文本转语音”的级联架构,改用原生语音流水线,具备以下特性:
1、通过单条WebSocket连接接收麦克风音频,并将生成的音频流式回传,全程不生成中间文本转录内容。
2、采用统一对话分词器,将输入音频转换为约50毫秒的隐式帧,完整保留语义、韵律、时序和情感线索。
3、在说话人结束发言前,就可持续更新内部状态并生成响应轨迹。
4、原生支持插话打断:如果用户在模型输出过程中开口说话,模型会立即取消正在生成的响应,开启新一轮对话。
该模型从交互质量、语音推理、工具调用、长上下文留存、端到端任务完成能力多个维度开展评估,重点聚焦重叠语音处理、持久对话状态维护和可靠工具执行这三项核心能力。
这个架构对机器性能有较高要求,因为语音比文本的数据量大,但现在计算机和网络硬件性能已经非常强大了,支撑这样的架构不成问题。另外语义、韵律、时序和情感线索这些语音之上的属性,变化较大,样本非常多,这也是语音AI的难点。
这一技术特性有着实际意义:根据Smallest.ai的官方文档,Hydra直接处理原始音频,并不会输出文本流。如果应用需要获取文本内容,必须使用Smallest.ai旗下的Pulse语音识别模型,单独对流入或流出的音频做转写处理。文档中还提到该产品支持“插话抢先”功能:当用户打断智能体发言时,系统可以直接丢弃正在生成的响应,立刻生成新的应答内容。
Kamath对这套架构的设计逻辑,参考了人类真实的对话模式。他在融资公告中提到:“人类在对话时,不会等对方说完才开始构思应答内容。”Smallest.ai希望复现这种对话时的并行处理逻辑,同时免去企业用户自行拼接不同供应商的语音识别、推理、语音生成模块的繁琐流程。
自主掌控语音识别、语音生成、流程编排以及端到端语音转语音推理全链路,让Smallest.ai可以更好地把控单分钟服务的单位成本。但这也带来了更重的技术负担:Smallest.ai需要保证每一层技术组件,相比专注对应赛道的垂直厂商都具备足够竞争力,同时还要满足企业级语音运营对可靠性与监控能力的严格要求。
部署模式也是其核心卖点之一:Smallest.ai支持本地部署与端侧推理两种方案,既可以减少网络往返产生的延迟,也能将用户数据完全保留在客户自有基础设施内部。Smallest.ai表示,其面向企业的产品支持基于角色的访问权限控制、客户自主可控的日志与链路追踪,同时满足SOC 2 Type 2、ISO 27001、HIPAA以及GDPR的合规要求。
如今语音智能体的技术已经发展到了新的阶段,在受控演示环境里输出流畅的语音表现,早已不是评判产品的核心标准。实际生产环境中的系统,要在数百万分钟的通话时长里,靠插话处理能力、运行时长达标率、合规能力、延迟表现与使用成本这五大维度来证明自身价值。Kamath和Mandloi正在下注:通过掌控全技术栈,Smallest.ai将获得足够的优化空间,同时在这五大维度上实现全面提升。
Smallest.ai的目标客户群体为联络中心、金融服务机构、医疗服务提供商以及业务流程外包商,这类场景下的语音系统必须妥善应对用户插话、背景噪音、敏感数据合规以及大通话流量的需求。
国内在“语音到语音”(Speech-to-Speech)和全双工实时语音交互方向上,已有多家公司布局,技术路径与Smallest.ai高度对标。
字节跳动(Seeduplex) 是这一方向上最直接的国内对标。2026年4月,字节正式推出原生全双工语音大模型Seeduplex,基于“边听边说”的全新框架设计,相比上一代半双工豆包端到端语音模型,交互自然感和顺畅度大幅提升。该模型已在豆包App全量上线,率先实现了全双工技术的规模化落地,可为上亿用户提供连续高质量的实时语音交互体验。
面壁智能(MiniCPM-o 4.5) 以9B参数规模实现了“原生全双工”架构,支持“边看、边听、主动说”的即时自由对话。模型在持续输出语音或文本的同时,仍能不间断地接收和处理新的视觉与听觉信息,并已在华为昇腾等6款国产芯片上完成端到端推理优化,适合手机、汽车、机器人等终端设备本地化运行。
模思智能(MOSS-Speech) 是这一路径上最直接的技术对标。该公司孵化于复旦大学OpenMOSS团队,首席科学家为邱锡鹏教授。其发布的MOSS-Speech实现了直接从语音理解到语音生成,无需文本中介,与传统“ASR→文本生成→TTS”的级联方案形成鲜明对比。该模型可在生成回答的同时捕捉语调、情绪、笑声等非文字信号,使机器“说话”更自然、更具人性。模思智能的差异化在于情境智能(Context Intelligence) 定位,核心目标是让AI理解信息发生时所处的真实情境——包括声音、画面、语气、情绪、人物关系等多维度信息,实现脱离传统硬件、无缝流畅、高度拟人化的人机交互。
阶跃星辰(StepAudio系列) 发布了Step-Audio 2 mini开源端到端语音大模型,集成了语音理解、音频推理与生成功能。其StepAudio 2.5 Realtime已全量上线,覆盖实时语音交互场景。在商业化落地上,阶跃星辰与吉利合作推出了业内首个搭载端到端语音模型的AgentOS智能座舱,量产车型吉利银河M9上市3个月销量接近4万辆,预计今年“上车”超百万辆。截至2026年初,其终端智能体API调用量连续三个季度增长近170%,国内60%头部手机品牌已与其达成深度合作,模型装机量超过4200万台。
VUI Labs(宇生月伴) 由上海交通大学钱彦旻教授创办,团队于2019年在全球首次提出端到端语音模型训练方法。其自研的多模态情感交互语音大模型Luna系列,语音对话延迟仅1.4秒,Luna-1在VoiceBench测评中获得79.05分,属于行业第一梯队。其技术路径明确对标Google、ElevenLabs、OpenAI、Hume AI、Sesame等语音模型厂商,专注于“超低延迟+情感交互+多模态智能体+端侧模型”的综合壁垒。
MiniMax(稀宇极智) 是国内语音大模型领域的重要玩家。2023年推出国内首个基于Transformer架构的语音大模型Speech01,2024年推出升级版本Speech02,综合性能跃升至全球领先水平。其新一代语音大模型Speech-02曾登顶国际权威语音评测双榜榜首。截至2025年底,其语音模型已覆盖超过200个国家和地区,帮助全球用户生成累计超过2亿小时的语音。
科大讯飞(星火语音大模型) 于2024年1月发布星火语音大模型,基于星火认知大模型强化声音复刻技术,支持一句录音复刻音色,整体性能对标OpenAI o3级别。云知声完成了U2-ASR与U2-TTS的全面升级,在语音大模型领域实现“百种方言”本土深耕到“全球多语种”拓展。
公司/团队 |
核心方向 |
对标Smallest.ai的维度 |
字节跳动 Seeduplex |
原生全双工语音大模型 |
全双工架构、规模化落地 |
面壁智能 MiniCPM-o |
原生全双工、端侧部署 |
全双工+多模态+端侧 |
模思智能 MOSS-Speech |
语音到语音、无文本中介 |
直接对标语音到语音路径 |
阶跃星辰 StepAudio |
端到端语音、实时交互 |
端到端+车载/手机落地 |
VUI Labs Luna |
端到端语音Agent、情感交互 |
低延迟+情感+Agent |
MiniMax Speech系列 |
语音大模型、多语言 |
语音基础模型能力 |
科大讯飞/云知声 |
传统ASR/TTS升级 |
声学基础+行业落地 |
从技术路线上看,国内对标公司普遍在全双工交互、端到端语音到语音、低延迟实时对话三个方向上与Smallest.ai形成正面竞争。字节跳动的Seeduplex和面壁智能的MiniCPM-o在全双工架构上最为接近,模思智能的MOSS-Speech在“无文本中介的语音到语音”路径上最为直接对标,而VUI Labs则在延迟指标(1.4秒)和情感交互能力上形成了差异化定位。
国内国外处理的主要语言不一样,国外是英文,国内是汉语。锐英源软件以前从事过蒙语的语音识别开发,蒙语语音音节和汉语差异大,调整的参数很多,所以国内外功能对标,但核心的数据没办法对标,进而国内才会发展出这样多的公司和产品。