(技术拆解)你看到的大部分AI+陪伴的demo底层其实都是这套系统
最近随着AI+陪伴硬件受到更多的关注,看到了各种相关的方案发现基本都还是用的小智的这套架构来做,确实也能理解,因为最方便直接出demo,而且默认自带的的“台湾妹”语音更容易吸引眼球。
我自己最近也用Seeed的一款硬件来玩了一下小智语音聊天机器人,确实融合了硬件后还是挺好玩的。同时顺手读了一下小智的技术文档,下面简单整理了小智的模型使用情况及其服务端代码分析供想玩的朋友们参考:
小智的模型使用情况
1. ASR 相关
- VAD(语音活动检测):
speech_fsmn_vad_zh-cn-16k-common-pytorch用于检测语音的起始和结束,过滤掉静默和噪音; - 核心 ASR:
SenseVoiceSmall用于将语音转换为文本,是小智语音识别的核心模型; - 声纹识别模型:
speech_eres2netv2w24s4ep4_sv_zh-cn_16k-common用于识别说话人的身份,可以用于区分不同的用户;
2. LLM
- 官方FAQ页面说是基于
QWen 72B进行“训练”和自部署,以及小智管理后台配置看是写的默认使用“Qwen 实时”; QWen是阿里开源的通义千问大语言模型,小智团队在其基础上进行了定制化的“训练”和部署,但具体细节尚未公开;
3. TTS 相关
- 火山引擎(Volcengine)
- 火山引擎的智能语音服务,提供多种音色的语音合成功能,默认的“湾湾小何”语音就是来自火山;
- 阿里云(Dashscope)
- 阿里云的智能语音服务;


