视频版大爆炸来了!剪辑可精准到每个字,支持中文Demo可玩,老罗:打钱

杨净 发自 凹非寺
量子位 | 公众号 QbitAI

现在剪视频,已经可以精准到每一个字了!

1bb578f2bb53127a17178891be64b067.gif

只需点击你要删减或者要留下的单词,AI分分钟都能给你整出新的视频来。

这操作,有点大爆炸功能内味了。老罗:打钱!

3104e864116f83a200e47b3c56c0b71b.gif

不管是MV、访谈、电影片段各种类型视频,也不论有无字幕,通通不在话下。

网友们纷纷开始试玩了起来。比如让rick roll鬼畜起来~

612113a118e237db41e8959d88b9cfdb.gif

7bf7cbd16791ffa9b990070837c6984d.png

就连中文视频也能Hold住。实测Demo发现,它甚至直接翻译成了英文。

不过这也并不影响整个操作,毕竟背后模型是支持中文在内的多个语言的。

c77507141da196419ec1d28e71f56af3.png

精准到每个字剪视频

只需三步,就可以轻松完成精准到字的视频剪辑——

上传视频、选择删减/留下的单词、下载视频。

afa101858ef546a3be1f38ae393e940e.png

释出的有三个示例,烹饪的美食视频、小扎采访、以及「Just Do IT」……

ecc857d383551754d370869fe497262e.png

当然你也可以自己试玩,各种语言都能识别。比如就以让子弹飞一段经典对白为例。

77135db5c5e0f9d0920f835142abed9b.png

绿色代表保留,红色代表删除。你有三种选择:剪辑、选择所有单词、重新设置。

任意选择保留单词之后,就可以「Cut Video」了。此处选择两处跳脱的台词。最终只花了不到十秒钟就完成了剪辑。

c8476b5cc49aa761fbea24e7894d0747.gif

画面切换可以说是十分顺滑了~整个Demo试玩在T4上运行。

基于Whisper模型

这是个荷兰开发者Matthijs Hollemans在HuggingFace上基于Whisper开发的新功能。

73d2fc8bdb436adb2c36064b01927363.png

Whisper是OpenAI于去年9月开源的语音识别神经网络,经过68万小时的多语言和多任务监督网络数据的训练,其鲁棒性和准确性接近人类水平。它可以进行多语言转录,以及其他语言将翻译成英文。

e5f6533384de019c71f577adab9df40e.png

它是基于Transformer端到端实现架构,无需任何微调。输入音频被分成30秒的块,转化为梅尔倒谱(音频特征提取方式之一,log-Mel spectrogram),然后传入编码器。

ab5df99b86eda5c0ce4d3fb344fff685.png

好了,试玩Demo在此,感兴趣的旁友可戳:
https://huggingface.co/spaces/radames/whisper-word-level-trim
参考链接:
[1]https://openai.com/research/whisper
[2]https://twitter.com/mhollemans/status/1671812176842039296

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值