1

python抓取网页内容urllib.request

已有 118 阅读此文人 - - Python爬虫 -

python抓取网页内容有不少库可以用,这里给大家分享一下用urllib.request的方法,代码如下

# -*- coding:utf-8 -*-
import urllib.request
site = 'http://www.h2b.cc'

response = urllib.request.urlopen(site)
html=response.read()
print(html)

Python urllib 库用于操作网页 URL,并对网页的内容进行抓取处理,urllib 包 包含以下几个模块:

urllib.request – 打开和读取 URL。

urllib.error – 包含 urllib.request 抛出的异常。

urllib.parse – 解析 URL。

urllib.robotparser – 解析 robots.txt 文件。

urllib.request怎么用,urllib.request 定义了一些打开 URL 的函数和类,包含授权验证、重定向、浏览器 cookies等。urllib.request 可以模拟浏览器的一个请求发起过程。我们可以使用 urllib.request 的 urlopen 方法来打开一个 URL,语法格式如下:

urllib.request.urlopen(url, data=None, [timeout, ]*, cafile=None, capath=None, cadefault=False, context=None)

url:url 地址。
data:发送到服务器的其他数据对象,默认为 None。
timeout:设置访问超时时间。
cafile 和 capath:cafile 为 CA 证书, capath 为 CA 证书的路径,使用 HTTPS 需要用到。
cadefault:已经被弃用。
context:ssl.SSLContext类型,用来指定 SSL 设置。

相关标签:python python爬虫 urllib
  • admin - 2021年12月17日

    可以看看

期待你一针见血的评论,Come on!