一、爬取目标

Python爬虫 l 我国农药信息网的农药挂号数据

二、完好源码

#""""""""""""""""""""""""""""""""""""""""""""""""""""""""""""
#
# Copyright (c) 2024 愤恨的it男, All Rights Reserved.
# FileName : code.py
# Date     : 2024.01.14
# Author   : 愤恨的it男
# Version  : 1.0.0
# Node     : 欢迎关注微信大众号【愤恨的it男】
#
#""""""""""""""""""""""""""""""""""""""""""""""""""""""""""""
import csv
import requests
from lxml import etree
from prettytable import PrettyTable
def getData(baseUrl, data, headers): 
    response = requests.post(url=baseUrl, data=data, headers=headers)
    html = etree.HTML(response.text)
    trs = html.xpath("//table[@id='tab']/tr")
    data = []
    for index,tr in enumerate(trs):
        text = tr.xpath("td//text()")
        if index !=0:
            text = [text[1].strip(),text[3],text[4],text[5],text[6],text[7],text[9].strip()]
            data.append(text)
    return data
def printData(result):
    table = PrettyTable()
    table.field_names = ["挂号证号", "农药称号", "农药类别", "剂型", "总含量", "有效期至", "挂号证持有人"]
    table.add_rows(result)
    print(table)
def saveData(result):
    with open('农药挂号数据.csv', 'w', encoding='utf-8', newline='') as file:
        writer = csv.writer(file)
        writer.writerows(result)
def main():
    baseUrl = 'https://www.icama.cn/BasicdataSystem/pesticideRegistration/queryselect.do'
    headers = {'Content-Type':'application/x-www-form-urlencoded',
               'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.3'}
    data = "pageNo=1&pageSize=50000&djzh=&nymc=&cjmc=&sf=&nylb=&zhl=&jx=&zwmc=&fzdx=&syff=&dx=&yxcf=&yxcf_en=&yxcfhl=&yxcf2=&yxcf2_en=&yxcf2hl=&yxcf3=&yxcf3_en=&yxcf3hl=&yxqs_start=&yxqs_end=&yxjz_start=&yxjz_end=&accOrfuzzy=2"
    result = getData(baseUrl, data, headers)
    printData(result)
    saveData(result)
if __name__== "__main__" :
    main()

三、源码简析

1、恳求头headers以及恳求载荷data

在Chrome浏览器开发者东西中抓包分析,能够知道本实例的恳求属于POST恳求,恳求头的Content-Type为application/x-www-form-urlencoded,还有称号/值对的恳求载荷数据,所以恳求头headers以及恳求载荷data设置如下:

baseUrl = 'https://www.icama.cn/BasicdataSystem/pesticideRegistration/queryselect.do'
headers = {'Content-Type':'application/x-www-form-urlencoded',
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.3'}
data = "pageNo=1&pageSize=50000&djzh=&nymc=&cjmc=&sf=&nylb=&zhl=&jx=&zwmc=&fzdx=&syff=&dx=&yxcf=&yxcf_en=&yxcfhl=&yxcf2=&yxcf2_en=&yxcf2hl=&yxcf3=&yxcf3_en=&yxcf3hl=&yxqs_start=&yxqs_end=&yxjz_start=&yxjz_end=&accOrfuzzy=2"

Python爬虫 l 我国农药信息网的农药挂号数据

Python爬虫 l 我国农药信息网的农药挂号数据

  • 恳求头中的Content-Type,就是B端发给S端的数据类型描述,即告诉服务器端,我给你传的数据是某种类型的,然后服务器端针对不同类型的数据做出不同的反应。常见的Content-Type类型:
application/x-www-form-urlencoded:载荷被URL编码为称号/值对的数据。
multipart/form-data:载荷被编码为二进制类型的数据(一般用来上传文件)。
application/json:载荷被编码为json格局的数据。
text/xml:载荷被编码为XML格局的数据。
  • 经过requests.get()进行GET恳求时不存在恳求实体部分,浏览器把载荷参数转换成一个字串a=1&b=2,然后把这个字串用?追加到URL尾部,因而恳求头不需求设置Content-Type字段。

  • 经过requests.post()进行POST恳求时,传入报文的参数有两个,一个是data,一个是json。用data参数提交数据时,request.body的内容则为a=1&b=2这种形式,用json参数提交数据时,request.body的内容则为{"a": 1, "b": 2}这种形式。

2、’utf-8’编码格局翻开文件

在运用open函数时,如果不指定文件编码格局,默许运用体系的编码格局。由于本人体系的编码格局为gbk,所以呈现了以下过错:

UnicodeEncodeError: 'gbk' codec can't encode character 'u2022' in position 12: illegal multibyte sequence

即’gbk’编码格局不能编码字符’u2022’,所以需求指定文件编码格局,能够运用’utf-8’编码格局来翻开文件。

def saveData(result):
    with open('农药挂号数据.csv', 'w', encoding='utf-8', newline='') as file:
        writer = csv.writer(file)
        writer.writerows(result)

四、爬取结果

 ------------ -------------------------------- ----------------------- -------------------------- -------------------------------------------------------- ------------ -------------------------------------------- 
|  挂号证号  |            农药称号            |        农药类别       |           剂型           |                         总含量                         |  有效期至  |                挂号证持有人                |
 ------------ -------------------------------- ----------------------- -------------------------- -------------------------------------------------------- ------------ -------------------------------------------- 
| PD20095400 |             咯菌腈             |         杀菌剂        |        可湿性粉剂        |                          50%                           | 2029-4-26  |         瑞士先正达作物保护有限公司         |
| PD20141067 |          氰烯己唑醇           |         杀菌剂        |          悬浮剂          |                          20%                           | 2029-4-24  |        陕西上格之路生物科学有限公司        |
| PD20141065 |          噻嗪毒死蜱           |         杀虫剂        |        可湿性粉剂        |                          30%                           | 2029-4-24  |        陕西上格之路生物科学有限公司        |
| PD20141049 |             吡蚜酮             |         杀虫剂        |        水分散粒剂        |                          70%                           | 2029-4-23  |        福建新农大正生物工程有限公司        |
| PD20095204 |             乙烯利             |     植物成长调节剂    |           水剂           |                          40%                           | 2029-4-23  |            侨昌现代农业有限公司            |
| PD20095203 |             烯唑醇             |         杀菌剂        |           原药           |                          95%                           | 2029-4-23  |        江苏七洲绿色化工股份有限公司        |
| PD20095180 |          苯吡甲草胺          |         除草剂        |         泡腾粒剂         |                          31%                           | 2029-4-23  |            丹东明珠科技有限公司            |
| PD20095175 |          藤酮辛硫磷           |         杀虫剂        |           乳油           |                          18%                           | 2029-4-23  |      广西施乐农化科技开发有限责任公司      |
| PD20095172 |             溴敌隆             |         杀鼠剂        |           母液           |                          0.5%                          | 2029-4-23  |     辽宁省沈阳爱威科技开展股份有限公司     |
| PD20095167 |             辛硫磷             |         杀虫剂        |           乳油           |                          40%                           | 2029-4-23  |        福建新农大正生物工程有限公司        |
| PD20095163 |             烯唑醇             |         杀菌剂        |        可湿性粉剂        |                         12.5%                          | 2029-4-23  |        江苏七洲绿色化工股份有限公司        |
| PD20095155 |            复硝酚钠            |     植物成长调节剂    |           水剂           |                          1.4%                          | 2029-4-23  |            德州祥龙生化有限公司            |
| PD20095146 |          五氯福美双           |         杀菌剂        |           粉剂           |                          40%                           | 2029-4-23  |       禾美思(山东)植物保护有限公司       |
| PD20095129 |             吡虫啉             |         杀虫剂        |        可湿性粉剂        |                          10%                           | 2029-4-23  |          江苏快达农化股份有限公司          |
| PD20095126 |            三十烷醇            |     植物成长调节剂    |         可溶液剂         |                          0.1%                          | 2029-4-23  |          浙江大鹏药业股份有限公司          |
| PD20095125 |             莠去津             |         除草剂        |        可湿性粉剂        |                          48%                           | 2029-4-23  |         河南贝力沃生物科技有限公司         |
| PD20095115 |     三氯吡氧乙酸丁氧基乙酯     |         除草剂        |           乳油           |                        480克/升                        | 2029-4-23  |          四川利尔作物科学有限公司          |
| PD20095108 |         高效氟吡甲禾灵         |         除草剂        |           原药           |                          96%                           | 2029-4-23  |              首建科技有限公司              |
| PD20095095 |          吡虫杀虫单           |         杀虫剂        |        可湿性粉剂        |                          35%                           | 2029-4-23  |          河南常见生物科技有限公司          |
| PD20141042 |          磺草莠去津           |         除草剂        |          悬浮剂          |                          40%                           | 2029-4-22  |            吉林金秋农药有限公司            |
| PD20095083 |           异丙甲草胺           |         除草剂        |           乳油           |                        720克/升                        | 2029-4-21  |         河南金田地农化有限责任公司         |

Python爬虫 l 我国农药信息网的农药挂号数据

Python爬虫 l 我国农药信息网的农药挂号数据

五、免责声明

本大众号所有源码均为个人学习所编写,仅可用于计算机技术学习及研究等合法行为,制止使用本大众号的源码从事任何违背本国(区域)法律法规的事务,如有发现存在违法违规行为我会举报到网监部门。