linux shell脚本如何将文本内容按空格分行、如何使用timit原始corpus制作wav的scp文件

最新推荐文章于 2021-04-29 08:12:17 发布

Yogurt0928

最新推荐文章于 2021-04-29 08:12:17 发布

阅读量4.7k

点赞数

分类专栏： linux Speech 文章标签： linux shell 脚本 linux timit kaldi

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/Yogurt0928/article/details/41948551

版权

Speech 同时被 2 个专栏收录

8 篇文章 0 订阅

订阅专栏

3 篇文章 0 订阅

订阅专栏

在kaldi-trunk提供的例子voxforge中有一个online-demo

直接使用就可以完成样例的在线解码并得到一个不错的结果，但是数据量很小

前段时间试了一下用另一个corpus来做同样的事情，但是效果很差

今天想用timit corpus来试一试

在修改run.sh脚本过程中遇到了很多问题，主要是对shell脚本操作不熟悉

其中有一个步骤是需要制作corpus中的wav的scp文件

timit的原始语料库中的文件层级是这样的：

第一级：

第二级：

第三极：

第四级：

第五级：

我这里只选择了TEST作为decoding的对象，所以只需要关注TEST目录下的结构，下面是scp文件制作实现过程：

step1：

> $decode_dir/input.scp

这一步是run.sh文件中原本就有的，但也很重要，即创建一个scp文件，同时还起到的一个作用是，如果之前生成过一个不需要的scp文件可以将其覆盖掉。

step2:

find $audio -not \( -iname 'SA*' \) -name '*.WAV' -print | xargs echo "" > $decode_dir/input.scp.temp

这一步达到的效果是将所有WAV文件中前缀不为SA的地址提取出来并存放在input.scp.temp这个中间文件中

这一步执行完之后得到的input.scp.temp文件是这个样子的：

也就是，我生成的文件中有三行，每一行都包括了很多个WAV文件，还不知道为什么会这样，这自然不是我希望得到的最后结果，所以需要进一步处理。

step3:

OLD_IFS="$IFS"
IFS=" "
cat $decode_dir/input.scp.temp | while read line
do

arr=($line)
IFS="$OLD_IFS"
for s in ${arr[@]}
do
echo ${s##*/} `pwd`"/$s" >> $decode_dir/input.scp
done
done

首先要实现的是将文本一行一行读入之后再用空格作为分隔符，将一行中的多个元素形成一个数组arr，详情请参考：http://my.oschina.net/5lei/blog/189559

然后是要制作成scp的格式，即文本的每一行为： wav名 wav所在的绝对路径

所以就有了echo ${s##*/} `pwd`"/$s" >> $decode_dir/input.scp这句话

${s##*/}的意思是取字符串s最后出现的 “/”这个字符，将这个字符及其左边所有的字符都删除掉，只取其右边剩下的部分，因此就得到了wav文件名

详情请参考：http://www.111cn.net/sys/linux/43822.htm

`pwd`"/$s"自然对应的就是wav文件的绝对路径了，`pwd`表示当前目录的绝对路径，后面再加上"/$s"也就构成了完整的文件路径。

最后终于得到了想要的scp文件：

就只是以上这一点东西就花了我一天的时间，主要还是对linux指令的使用太不熟悉，

如果熟悉linux指令的话这应该是很简单的事情，好好学习，希望越来越好。

关注

0
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
linux shell脚本如何将文本内容按空格分行、如何使用timit原始corpus制作wav的scp文件

在kaldi-trunk提供的例子voxforge中有一个online-demo直接使用就可以完成样例的在线解码并得到一个不错的结果，但是数据量很小前段时间试了一下用另一个corpus来做同样的事情，但是效果很差今天想用timit corpus来试一试在修改run.sh脚本过程中遇到了很多问题，主要是对shell脚本操作不熟悉其中有一个步骤是需要制作corpus中的wav的sc
复制链接

扫一扫

专栏目录

Yogurt0928 CSDN认证博客专家 CSDN认证企业博客

码龄12年

20: 原创

25万+: 周排名

207万+: 总排名

8万+: 访问

: 等级

1014: 积分

14: 粉丝

8: 获赞

5: 评论

26: 收藏

私信

关注

热门文章

分类专栏

Speech 8篇
C++/C# 4篇
linux 3篇
Perl 4篇
机器学习 1篇

最新评论

合并多个wav文件
imperialeast: 我写了一个vb6的dll 可以合并多个wav,我的邮箱xiayu50000@126.com
HTK model转Kaldi model实录——convert_htk的使用
森林里的熊猫: 你好，文章写的很详细，有一个问题想要咨询一下，./convert_htk.sh ../.. MMF TREES convert_dir ，该命令中的MMF文件应该是MMF.txt 文本格式吧，如果是的话，请问怎么把二进制的MMF转化为MMF.txt格式啊？谢谢啦
C#如何读取二进制文件（float32）
丁劲犇: 额，前面一直用Qt/C++，以及Python. 最近维护一个别人的项目，发现，这个 .Netframework的API真的太，，太长了。为了转换一个类型，要一堆前置的命名空间、对象构造。不知道有没有人有同感。
Kaldi随笔（一）
henzhai: 你好，我最近也想求dnn训练后的后验概率，但是能不能麻烦你详细说一下那个nnet-forward怎么用啊？看了这篇博客我还是不太懂，我等的比较急，希望你看到后能给我回封邮件，我的邮箱是wx19896@163.com，感谢你的！
Kaldi随笔（二）
sa1ka: 博主你好，我最近也在做和你相似的事情，看了你kaldi的这2篇博文收获很大，至于要获得每一帧对应每个phone的概率，是不是需要使用forward-backward算法来计算，你在这个方面还有新的进展吗？

大家在看

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。