python怎么查看网页编码格式_怎么用python爬取网页文字?

7a22c64c1e98836b494d4fd09fd97000.png

用Python进行爬取网页文字的代码:#!/usr/bin/python# -*- coding: UTF-8 -*-import requestsimport re# 下载一个网页url = 'htt

56d4c8dec49c311b58d1516850e01525.png

用python进行爬取网页文字的代码:

  1. #!/usr/bin/python

  2. # -*- coding: UTF-8 -*-

  3. import requests

  4. import re

  5. # 下载一个网页

  6. url = 'https://www.biquge.tw/75_75273/3900155.html'

  7. # 模拟浏览器发送http请求

  8. response = requests.get(url)

  9. # 编码方式

  10. response.encoding='utf-8'

  11. # 目标小说主页的网页源码

  12. html = response.text

  13. print(html)

834b33ca67367825a611787fd8c657ec.gif

1、编写爬虫思路:

18f9b1c02fecc293ed01ebc37c023fa9.png

确定下载目标,找到网页,找到网页中需要的内容。对数据进行处理。保存数据。

2、知识点说明:

18f9b1c02fecc293ed01ebc37c023fa9.png

1)确定网络中需要的信息,打开网页后使用F12打开开发者模式。
在Network中可以看到很多信息,我们在页面上看到的文字信息都保存在一个html文件中。点击文件后可以看到response,文字信息都包含在response中。
对于需要输入的信息,可以使用ctrl+f,进行搜索。查看信息前后包含哪些特定字段。
对于超链接的提取,可以使用**左边的箭头点击超链接,这时Elements会打开有该条超链接的信息,从中判断需要提取的信息。从下载小说来看,在目录页提取出小说的链接和章节名。

2)注意编码格式

18f9b1c02fecc293ed01ebc37c023fa9.png

输入字符集一定要设置成utf-8。页面大多为GBK字符集。不设置会乱码。

d25193019de0abb52c428a60b684674c.gif

动力猫机器人教育专注于青少年STEAM教育、创客教育产品及课程体系的开发,为3-18岁学生提供全方位STEAM创客教育课程解决方案。
目前公司已取得多项发明专利、实用新型专利及多项软件著作权专利,拥有上百种控制器、传感器等电子模块,近300种机械结构件,兼容国内外主流编程软件,能够实现较为复杂的物联网和人工智能项目的模型搭建,能充分满足教学、比赛、创新创意等多种需求。
      公司产品进入了中国电子学会发起的“全国青少年机器人技术等级考试”准用器材系列,自主研发软件Scraino已经写入山东中小学三个版本的信息技术课本,在天津、河北、山东等地开展培训中心业务,为美国加州中小学课堂提供产品。
     动力猫课程依托自身强大的研发实力,软硬件相结合,软件方面拥有业界领先的 Scraino(具有自主产权)图形化编程软件以及配套的电子件(各类传感器及控制器等);硬件采用硬件采用动力猫的idea-x积木,该积木具有多项国家发明专利,六面拼插,多方式组合,围绕6-18岁适龄儿童在教具器材、编程平台、评价机制及课程体系、技能等级评测、科技创意赛事等领域多元化搭建教育平台。其 Scraino、Python 课程,不仅能编程,还能通过自主研发的 Nano 控制器,各类传感器,实现机器人物联网课程学习,搭建属于自己的智慧机器人。

声明:编辑此文是出于传递更多信息之目的。若有来源标注错误或侵犯了您的合法权益,请作者持权属证明与本号联系,我们将及时更正、删除,谢谢。

526f8e741a3769befadb3b26f91c317e.png

Published by

风君子

独自遨游何稽首 揭天掀地慰生平

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注