BOW(Bag of Words)词袋模型理解

基本词袋模型:

词袋模型的提出是为了解决文档分类,例如一个文员收到一个任务:把手里的共计10M的公司不同部门的相关工作文件进行归档分类,分别为财务部、公关部、市场部、管理层等四个部门,那么应该怎么做呢?

具体方法为:假设财务部的文件用“金额数目”表示,公关部用“客户数字”表示,市场部用“竞争对手”表示,管理层用“上市情况”表示。那么,我们依次将所有字体组合得到“金额数目客户字竞争对手上市情况”中字体依次用数字表示得到“0123456789abcde”一个15维的向量,那么不同部门文件分别可以表示为“111100000000000”、“001011100000000”等不同分布的特征向量,这样经过对训练数据进行特征表示方法学习,得到特征表示模型,输入新的文件时可以得到相应的特征表示,合理设计分类器既可以快速准确的将该文档进行归类。

那么,当将用于文档检索的磁带模型转移到视觉任务中需要怎么做呢?

  • 1
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值