【ChatGPT】柯南的"变声蝴蝶结"

大家好,我是千寻哥,在咱们编程导航里面,我一共有开设了三个专栏目,《简单好玩的AI算法》,《计算机前言知识科普》,至于第三个专栏的内容,哈哈哈,先卖个关子,留个彩蛋!


现在ChatGPT大模型的火爆程度,我相信不必我多言,随着人工智能大模型的兴起,属实也给工业界带来了不少的“冲击”,其实行业冲击是一个中性词,冲击既会带来“生机”但也有可能带来“危机”。


“生机”在于随着ChatGPT大模型的兴起,方便了我们的生活,而“危机”则是,ChatGPT大模型的便利也会在一定程度上,取代程序员的工作,那么怎么办呢?我的老东家阿里有过一句名言:唯一不变的是变化,所以程序员需要拥抱变化!



我个人猜测,未来程序员的招聘要求,可能要加上这样一条要求:


“熟练使用ChatGPT等大模型AIGC生成工具,进而提高代码工程开发效率。”


所以站在风口上,也是为了增加我们的不可取代性,我们要将ChatGPT的效率工具实际融入到我们的开发工作,甚至在日常生活中去,做到为我们所用!


今天以一个实际的算法项目为例,和大家介绍一个ChatGPT的应用实践。这个项目对于语音算法工程师,可能会使用的起来更加的方便,并且对后续的算法研究更有研究意义。


ChatGPT属于大模型的文字对话模型。真没想不到,在语音音频领域,ChatGPT都没有放过,ChatGPT真的是开始影响各行各业。相信大家都看过名侦探柯南,千寻以前就特别羡慕“蝴蝶结型变声器”。



而今天和大家介绍的大模型应用是OpenAI公司推出的AudioGPT模型应用,那效果,简直就是一个现实版本柯南的“变声蝴蝶结”。


与ChatGPT的自然语言生成模型的明显区别在于AudioGPT的应用是针对于语音算法的领域。AudioGPT模型可实现的功能有以下几点,都很有意思,给大家总结一下。


另外大家需要注意的是AudioGPT的使用是需要基于ChatGPT账号为基础的,为什么这么说呢?原因在于需要我们通过使用OpenAI的API key进访问权限的验证,如图为OpenAI key的获取示意图,需要进行手动生成。



所以大家如果还没有OpenAI的ChatGPT账号的,自己去申请一下,然后将这个API Key放到这个AudioGPT的输入框中,即可进行运行程序。


以下是AudioGPT程序的Github社区地址:


https://github.com/AIGC-Audio/AudioGPT


以下跟大家演示一下如何在自己的Windows电脑上去运行AudioGPT的代码程序,以及如何学会正确运用AudioGPT实现对应的功能?


首先需要实现搭建模型运行环境,然后安装requirements文件列表里面的这安装依赖项,以及怎么实现在我们本地的客户端去运行AudioGPT的程序。


1. 创建运行程序新的conda环境


# create a new environment
conda create -n audiogpt python=3.8


2. 安装环境运行所需依赖,以及下载模型文件


# prepare the basic environments
pip install -r requirements.txt

# download the foundation models you need
bash download.sh


3. 导入你的OpenAI Key字符串进入代码文件


# prepare your private openAI private key
export OPENAI_API_KEY={Your_Private_Openai_Key}


4. 开始运行AudioGPT程序


python audio-chatgpt.py


至此我们可以实际检验AudioGPT的实际功能。


以上的操作步骤还是似乎还是偏向于极客,可以直接使用Hugging Face社区,调用实际的API接口,使用更加方便。以下是Hugging Face社区的代码地址:


https://huggingface.co/spaces/AIGC-Audio/AudioGPT


AudioGPT效果如下图所示:



实践环节演示

AudioGPT包括以下几种功能,由于AudioGPT的模型属于语音音频方向的大模型。其功能包括以下的内容分类。


第一、实现根据输入文本转换为语音文件的语音合成


例如:生成带有文本“here we go”的语音音频



第二、实现将单通道语音转换为双通道语音



第三、根据语言的文本描述生成对应语音


例如:生成狗叫声的音频:



第四,根据音频输出指定文字的描述


例如:给我这个生成音频的描述



第五、根据输入语音信号转换输出其对应的频谱图



第六、说明音频内部所包含的事件以及起止时间


例如:这段音频中的雷声是什么时候发生的?



不仅如此,AudioGPT也集成了图像识别的功能,根据图片输入的上传图片生成对应的内容描述音频


例如:上传下图的江南水乡的图片



然后通过江南水乡的图片,生成的雨水声音



怎么样感觉效果如何?不过其实告诉大家一个秘密,音频信号的处理,相对来说,比较占用内存,处理音频的时间较长,可以选择不同的加速硬件GPU,如下图所示



原始使用的T4显卡是免费的,其实理论上计算性能也还不错,免费的,还要啥自行车!不过如果真得有更多的需要,当然也可以按需购买。


怎么样,赶快试一试吧!后续我会和大家分享更多关于ChatGPT的相关应用知识,让大家一起在风口上飞起来,提高我们程序员的开发效率,拿到满意的offer,升职加薪!hhh


我是千与千寻,一个只讲干活的码农,我们下期见~

0个评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
千与编程
下载 APP