0571-81111602

更新时间:2026-08-15 00:02:46

已登记

详细信息

  • 知识产权名称

    用于声音意图识别模型的训练数据

  • 登记编号

    DIP2025000007458

  • 申请人

    杭州秋果计划科技有限公司

  • 登记类型

    首次登记

  • 登记有效期

    3年

  • 申请时间

    2025-06-12 15:29:34

详细信息

  • 所属行业

    信息传输、软件和信息技术服务业

  • 交易状态

    待交易

  • 数据规模

    100000

  • 更新频次

    每月更新

  • 应用场景

    本训练数据用于声音意图识别模型的训练和优化。训练好的意图识别模型能够通过分析音频内容来理解说话者的意图。在智能眼镜的人机交互场景中,训练模型通过准确理解用户的意图,智能眼镜可以提供更加自然和直观的交互方式,从而通过意图识别模型增强智能眼镜的用户体验,提高交互效率。例如,用户只需简单地注视某个物体或说出一个指令,系统就能理解其意图并执行相应的操作,如拍照、查询信息等。

  • 算法规则简要说明

    (1) 数据收集:人工收集和生成的文本数据【text】、文本意图数据【intent】。 (2) 数据处理:以说话人编号【speaker_audio】对应的人声特征作为TTS模型的输入,不同的说话人编号对应有不同的人声特征,分别用多个TTS模型把文本数据转换成音频数据,并存储到存储路径【audio_path】; 分别用下面四个ASR模型对音频数据进行语音识别: 用qwen的ASR模型得到的语音识别结果【text_qwen】; 用paddle的ASR模型得到的语音识别结果【text_paddle】; 用whisper的ASR模型得到的语音识别结果【text_whisper】; 用paraformer的ASR模型得到的语音识别结果【text_paraformer】; 对以上4个语音识别结果进行片段投票得到结果【text_vote】,标记投票得到的结果的不同之处【diff_spans】,计算投票结果与文本【text】的一致率。 (3) 在标注好的数据集上训练ASR深度学习模型,把语音作为模型输入,文本【text】和文本的意图【intent】作为模型输出,基于whisper或paraformer架构的asr模型进行训练,得到训练好的ASR模型。训练好的ASR模型在接收到用户输入的音频数据后,可以得到用户的意图。 (4) 超参数调优:进行超参数调优,包括学习率、批量大小、网络层数等,以优化模型性能。 (5) 模型优化与验证:根据评估结果,对模型进行剪枝、正则化等优化措施。在独立的测试集上验证模型的性能,确保模型在未见数据上也能表现良好。

  • 更新频次

    每月更新

  • 存证平台

    信证链数据资产存证公证平台

有购买意向,请电话联系: 0571-81111602