| 网站首页 | 业界新闻 | 小组 | 威客 | 人才 | 下载频道 | 博客 | 代码贴 | 在线编程 | 编程论坛
欢迎加入我们,一同切磋技术
用户名:   
 
密 码:  
共有 1273 人关注过本帖
标题:{爬虫问题}网页数量不知,如何确定线程何时结束? 而且要保证爬完。
只看楼主 加入收藏
pypro
Rank: 1
等 级:新手上路
帖 子:18
专家分:0
注 册:2010-4-10
结帖率:80%
收藏
 问题点数:0 回复次数:2 
{爬虫问题}网页数量不知,如何确定线程何时结束? 而且要保证爬完。
{爬虫问题}网页数量不知,如何确定线程何时结束?
而且要保证爬完。
搜索更多相关主题的帖子: 线程 爬虫 结束 数量 网页 
2010-04-15 16:08
外部三电铃
Rank: 16Rank: 16Rank: 16Rank: 16
来 自:那一年
等 级:贵宾
威 望:57
帖 子:2013
专家分:7306
注 册:2007-12-17
收藏
得分:0 
多线程爬虫吧,每采集一个页面的时候在控制台用print输出一段内容,比如“正在采集XXX……”,这样采集的时候控制台会接连不断的输出内容。

如果超过5分钟不输出内容,基本上算是爬完了

那一年,苍井空还是处女
2010-04-15 20:01
pypro
Rank: 1
等 级:新手上路
帖 子:18
专家分:0
注 册:2010-4-10
收藏
得分:0 
回复 2楼 外部三电铃
每个线程任务设定的是从队列里取一个URL爬

由于不知道具体网页数量,队列里的结束标记也不好放

理论上应该可以设定一段时间内没有输出就结束线程

但是这个PYTHON能实现不?
2010-04-15 21:10
快速回复:{爬虫问题}网页数量不知,如何确定线程何时结束? 而且要保证爬完。
数据加载中...
 
   



关于我们 | 广告合作 | 编程中国 | 清除Cookies | TOP | 手机版

编程中国 版权所有,并保留所有权利。
Powered by Discuz, Processed in 0.064576 second(s), 7 queries.
Copyright©2004-2024, BCCN.NET, All Rights Reserved