您当前的位置：首页 > IT编程 > python
\| C语言 \| Java \| VB \| VC \| python \| Android \| TensorFlow \| C++ \| oracle \| 学术与代码 \| cnn卷积神经网络 \| gnn \| 图像修复 \| Keras \| 数据集 \| Neo4j \| 自然语言处理 \| 深度学习 \| 医学CAD \| 医学影像 \| 超参数 \| pointnet \| pytorch \| 异常检测 \| Transformers \| 情感分类 \| 知识图谱 \|

自学教程：热门问题python爬虫的效率如何提高

51自学网 2022-02-21 10:50:05

python

这篇教程热门问题python爬虫的效率如何提高写得很实用，希望能帮到您。

简单版本爬虫

我们先来一个简单的爬虫，看看单线程处理会花费多少时间？

import timeimport requestsfrom datetime import datetimedef fetch(url):    r = requests.get(url)    print(r.text)start = datetime.now() t1 = time.time()for i in range(100):    fetch('http://httpbin.org/get') print('requests版爬虫耗时：', time.time() - t1)# requests版爬虫耗时：54.86306357383728

我们用一个爬虫的测试网站，测试爬取100次，用时是54.86秒。

多线程版本爬虫

下面我们将上面的程序改为多线程版本：

import threadingimport timeimport requestsdef fetch():    r = requests.get('http://httpbin.org/get')    print(r.text)t1 = time.time()t_list = []for i in range(100):    t = threading.Thread(target=fetch, args=())    t_list.append(t)    t.start() for t in t_list:    t.join() print("多线程版爬虫耗时：", time.time() - t1)# 多线程版爬虫耗时：0.8038511276245117

我们可以看到，用上多线程之后，速度提高了68倍。其实用这种方式的话，由于我们并发操作，所以跑100次跟跑一次的时间基本是一致的。这只是一个简单的例子，实际情况中我们不可能无限制地增加线程数。

多进程版本爬虫

除了多线程之外，我们还可以使用多进程来提高爬虫速度：

import requestsimport timeimport multiprocessingfrom multiprocessing import PoolMAX_WORKER_NUM = multiprocessing.cpu_count() def fetch():    r = requests.get('http://httpbin.org/get')    print(r.text) if __name__ == '__main__':    t1 = time.time()    p = Pool(MAX_WORKER_NUM)    for i in range(100):        p.apply_async(fetch, args=())    p.close()    p.join()     print('多进程爬虫耗时：', time.time() - t1) 多进程爬虫耗时： 7.9846765995025635

我们可以看到多进程处理的时间是多线程的10倍，比单线程版本快7倍。

协程版本爬虫

我们将程序改为使用 aiohttp 来实现，看看效率如何：

import aiohttpimport asyncioimport time async def fetch(client):    async with client.get('http://httpbin.org/get') as resp:        assert resp.status == 200        return await resp.text() async def main():    async with aiohttp.ClientSession() as client:        html = await fetch(client)        print(html) loop = asyncio.get_event_loop() tasks = []for i in range(100):    task = loop.create_task(main())    tasks.append(task) t1 = time.time() loop.run_until_complete(main()) print("aiohttp版爬虫耗时：", time.time() - t1) aiohttp版爬虫耗时： 0.6133313179016113

我们可以看到使用这种方式实现，比单线程版本快90倍，比多线程还快。

结论

通过上面的程序对比，我们可以看到，对于多任务爬虫来说，多线程、多进程、协程这几种方式处理效率的排序为：aiohttp > 多线程 > 多进程。因此，对于简单的爬虫任务，如果想要提高效率，可以考虑使用协程。但是同时也要注意，这里只是简单的示例，实际运用中，我们一般会用线程池、进程池、协程池去操作。

这就是问题的答案了吗？

对于一个严谨的程序员来说，当然不是，实际上还有一些优化的库，例如grequests，可以从请求上解决并发问题。实际的处理过程中，肯定还有其他的优化点，这里只是从最常见的几种并发方式去比较而已，应付简单爬虫还是可以的，其他的方式欢迎大家在评论区留言探讨。

以上就是热门问题python爬虫的效率如何提高的详细内容，更多关于python爬虫效率提高的资料请关注51zixue.net其它相关文章！

Python 字符串操作详情
Python列表的定义及使用

自学教程：热门问题python爬虫的效率如何提高

目录

简单版本爬虫

多线程版本爬虫

多进程版本爬虫

协程版本爬虫

结论