文档简介
标签:
搜索引擎增量式搜集的实现与评测
针对传统的周期性集中式搜索(Crawler)的弱点和增量式Crawler的难点,提出预测更新策略,给出判别网页更新的MD5算法、URL调度算法和URL缓存算法,描述系统各个模块的分布式构架的实现,建立测试集数据对算法进行评测。该系统在北大天网搜索引擎上运行半年多,更新周期缩短了20天,变化预测命中率达到79.4%,提高了时效性、扩展性和稳定性。关键词:增量式搜集;网页变化预测;搜索引擎
评论
加载更多
推荐下载
查看更多
精选文集
相关视频
推荐帖子