论文部分内容阅读
由于领域外话语具有内容短小、表达多样性、开放性及口语化等特点,限定领域口语对话系统中超出领域话语的对话行为识别是一个挑战.本文提出了一种结合外部无标签微博数据的随机森林对话行为识别方法.本文采用的微博数据无需根据应用领域特点专门收集和挑选,又与口语对话同样具有口语化和表达多样性的特点,其训练得到的词向量在超出领域话语出现超出词汇表字词时提供了有效的相似性扩展度量.随机森林模型具有较好的泛化能力,适合训练数据有限的分类任务.中文特定领域的口语对话语料库测试表明,本文提出的超出领域话语的对话行为识别方法取得了优于最大熵、卷积神经网络等短文本分类研究进展中的方法的效果.