当前位置: 首页 » 资讯 » 新科技 » 正文

阿里通义千问开源新一代音频语言模型 支持语音聊天且内容精准度更高

IP属地 北京 编辑:郑佳 太平洋科技 时间:2024-08-13 21:02:39

近日,阿里巴巴旗下通义千问团队宣布正式开源Qwen2-Audio系列的两个模型——Qwen2-Audio-7B和Qwen2-Audio-7B-Instruct。Qwen2-Audio系列模型作为大规模音频语言模型,具备接受多种音频信号输入的能力,并能根据语音指令进行音频分析或直接生成文本响应。

Qwen2-Audio提供两种交互模式。一是语音聊天模式,用户可无需文本输入,直接通过语音与模型进行互动;二是音频分析模式,用户可结合音频和文本指令对音频内容进行分析,并且该模型支持超过8种语言和方言,包括中文、英语、法语、意大利语、西班牙语、德语、日语和粤语,满足不同用户的需求。

Qwen2-Audio与上一代模型Qwen-Audio相比,Qwen2-Audio在声音理解能力和指令跟随能力上均实现了显著提升,通义团队还发布了一套全新的音频理解模型测评基准,相关论文已被国际顶级会议ACL 2024收录。

该模型具有高性能、易于集成和可微调的特点,代码已集成到Hugging Face的transformers库,方便开发者快速上手和使用。

在一系列基准数据集的测试中,Qwen2-Audio系列模型的表现超越了之前的最佳模型,展现了其在音频处理领域的领先地位。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

全站最新