本文参考自:https://www.zhihu.com/question/32286630
LDA中topic个数的确定是一个困难的问题。
当各个topic之间的相似度的最小的时候,就可以算是找到了合适的topic个数。
参考
一种基于密度的自适应最优LDA模型选择方法 ,简略过程如下:
- 选取初始K值,得到初始模型,计算各topic之间的相似度
- 增加或减少K的值,重新训练得到模型,再次计算topic之间的相似度
- 重复第二步直到得到最优的K