温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

lda舆情监测遇到的问题

发布时间:2020-05-01 14:59:47 来源:网络 阅读:674 作者:中天剑j 栏目:开发技术

1、问题一

LDA求出主题-词 概率phi之后。可以知道每个主题下每个词的概率,之后怎么确定每篇文档的主题分布呢?

 在 gibbs抽样稳定之后,统计每篇文档topic出现的频率就可以算出来。

2、问题二

每个主题下的词有可能是相同的,只是概率不同而已。统计时这个应该算在哪个主题下?

3、问题三

训练集--维基百科数据集是 自己用爬虫爬,还是直接下载。

4、问题四

LDA模型构建完后,可以估计每篇文档的主题。但是之后要怎么知道当前舆论的热点呢?

5、问题五

Elasticsearch 是用来存取新闻和微博模块的数据,这样我可以设置一个表,表中的每一项(url-主题-发布时间-爬取时间-作者-摘要)这样搜索的时候就可以搜索出关于某个主题的所有url。

6、问题六

关于LDA的训练集的问题。这个训练集是自己爬取,然后分词得到的。

7、问题七

怎么将舆情信息展示出来。(按爬取文档的主题出现的概率排序)可以用图表表示出所有主题出现的的概率。柱状图。

解决完这七个问题,整个系统基本成型

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI