nutch中怎么配置hadoop

发布时间：2021-08-11 15:20:40 来源：亿速云阅读：189 作者：Leah 栏目：开发技术

这期内容当中小编将会给大家带来有关nutch中怎么配置hadoop，文章内容丰富且以专业的角度为大家分析和叙述，阅读完这篇文章希望大家可以有所收获。

中文分词：
1.对建立索引所用分词工具的修改
将下载的中文分词包放到lib目录下，改名为analysis-zh.jar(当然，你也可以不用改）。找到下面文件
src\java\org\apache\nutch\analysis\NutchDocumentAnalyzer.java
修改tokenStream方法如下
publicTokenStreamtokenStream(StringfieldName,Readerreader){
Analyzeranalyzer;
analyzer=newMMAnalyzer();
returnanalyzer.tokenStream(fieldName,reader);
}
注意：由于加入信息的分析类，你需要将该类导入。使用如下语句。
importjeasy.analysis.*;

2.对查询所用分析部分的修改
nutch+hadoop配置使用总需要对查询所用分析部分的修改。src\java\org\apache\nutch\analysis\中的NutchAnalysis.jj文件
将<SIGRAM:<CJK>>
改为:|<SIGRAM:(<CJK>)+>
使用javacc工具将NutchAnalysis.jj生成java文件，共会生成7个java文件，将他们拷贝到下面的文件夹中替换原有文件。
src\java\org\apache\nutch\analysis

如何安装与使用javacc？
下载javacc并解压，然后将javacc的主目录添加到环境变量下。进入命令行，输入javacc，如果不出现不能识别该命令之类的说法，证明安装成功。
进入NutchAnalysis.jj文件所在的目录，输入javaccNutchAnalysis.jj命令就会生成7个java文件了。

3.重新编译工程文件
这里你需要用到ant工具了，那么ant工具怎么安装呢？
ant的安装与配置与javacc类似，下载后解压，然后在path环境变量中加如指向ant下的bin文件夹的路径。
使用：从命令行进入nutch目录中，输入ant命令，它会自动根据当前目录下的build.xml进行重建。重建完毕后会在改目录下产生一个build文件夹。

4.重建后的文件替换
一、将nutch-0.x.x.job文件拷贝出来替换nutch目录下的同名文件。
二、将\build\classes\org\apache\nutch\analysis目录下的所有文件拷贝替换nutch-0.x.x.jar中org\apache\nutch\analysis目录下的文件。
三、将nutch-0.x.x.jar文件和你的分词包（我的是analysis-zh.jar）拷贝到tomcat中WEB-INF\lib下面。

5.重新爬行与建立索引，重新启动tomcat即可。

nutch搜索url过滤规则：
对于每一次(由depth决定)对url进行filter，所以要搜子页面，首页一定要通过filter，否则搜索不到。

上述就是小编为大家分享的nutch中怎么配置hadoop了，如果刚好有类似的疑惑，不妨参照上述分析进行理解。如果想知道更多相关知识，欢迎关注亿速云行业资讯频道。

向AI问一下细节

nutch中怎么配置hadoop

猜你喜欢

最新资讯

相关推荐

相关标签