论文部分内容阅读
主题模型(latent topic model)用于提取隐含在文档集中的主题,其中每个主题是语义相关的一些词的多项式分布。主题模型不但可以发现隐含在文档中的语义信息,而且能够按照主题的规模实现文档的维度约简。本文对主题模型的产生背景、研究现状、研究方法以及存在的问题做了较详细的阐述,在此基础上,提出了一种结合词相似性与CRP(Chinese Restaurant Process)的隐主题模型,该模型能够自动确定主题的数目,并产生主题的相应词分布。通过实验验证,该方法具有运算速度快,模型简单的特点,具有良好的实用价值。