【计算机测量与控制】针对微博的免登录分布式网络爬虫的研究-发表云网

首页 > 期刊 > 计算机测量与控制 > 针对微博的免登录分布式网络爬虫的研究【正文】

针对微博的免登录分布式网络爬虫的研究

王林; 刘星辰西安理工大学自动化与信息工程学院; 西安710000

免登录网络爬虫分布式网络爬虫 hadoop mapreduce

摘要：微博作为优质的数据源,其中的数据非常适合做舆情分析等;新浪官方提供的API限制数据采集速度,而利用模拟登录的网络爬虫采集数据又相对复杂且会降低效率;针对这些问题,设计了一个免登录的微博网络爬虫;通过实验表明,该爬虫可以更快的对微博数据进行完整稳定的采集;随着对数据需求量越来越大,单机网络爬虫已经不足以满足要求,将Hadoop分布式计算平台与免登录爬虫相结合,设计了一个基于MapReduce的分布式网络爬虫系统,利用多台计算机组成的集群,实现短时间内免登录抓取海量微博数据;通过实验证明,该爬虫系统可以每天稳定抓取近千万条微博。

简介：《计算机测量与控制》（CN：11-4762/TP）是一本有较高学术价值的大型月刊，自创刊以来，选题新奇而不失报道广度，服务大众而不失理论高度。颇受业界和广大读者的关注和好评。

注：因版权方要求，不能公开全文，如需全文，请咨询杂志社

文秘咨询投稿咨询

针对微博的免登录分布式网络爬虫的研究

相关期刊

相关论文

期刊推荐

订购杂志

文秘咨询