0

0

从 ASP.NET 网站抓取 HTML 表格数据的实用指南

花韻仙語

花韻仙語

发布时间:2025-08-26 13:52:35

|

986人浏览过

|

来源于php中文网

原创

从 asp.net 网站抓取 html 表格数据的实用指南

本文旨在提供一个清晰、高效的解决方案,用于从动态 ASP.NET 网站抓取表格数据。通过模拟网站的 POST 请求,绕过 Selenium 的使用,直接获取包含表格数据的 HTML 源码。结合 BeautifulSoup 和 Pandas 库,实现数据的解析、清洗和提取,最终以易于阅读的表格形式呈现。该方法适用于需要自动化抓取此类网站数据的场景,能有效提高数据获取的效率和稳定性。

从 ASP.NET 网站抓取数据,特别是表格数据,有时会遇到一些挑战。传统的 requests 结合 BeautifulSoup 可能无法直接获取到动态加载的内容,而使用 Selenium 虽然可以解决动态加载的问题,但效率相对较低。本文介绍一种更高效的方法,通过分析网站的请求,模拟 POST 请求直接获取包含表格数据的 HTML 源码,然后利用 BeautifulSoup 和 Pandas 库进行解析和提取。

步骤详解

  1. 分析网站请求

    首先,需要分析目标网站的请求方式和参数。使用浏览器的开发者工具(通常按 F12 键打开),在 Network 选项卡中观察网页加载过程中发送的请求。特别是 POST 请求,通常包含一些关键的参数,例如 __VIEWSTATE、__EVENTVALIDATION 等。这些参数是 ASP.NET 用来维护页面状态的,需要在后续的请求中携带。

    立即学习前端免费学习笔记(深入)”;

  2. 获取关键参数

    使用 requests 库获取网页的初始 HTML 源码,然后使用 BeautifulSoup 解析 HTML,提取 __VIEWSTATE 和 __EVENTVALIDATION 的值。

    import requests
    from bs4 import BeautifulSoup
    
    url = "https://serviciosede.mineco.gob.es/indeco/reports/verSerieGraf.aspx/?codigo=230400&frec=-1"
    
    with requests.Session() as s:
        soup = BeautifulSoup(s.get(url).text, "lxml")
    
        # Get the viewstate and eventvalidation values first
        payload_data["__VIEWSTATE"] = soup.select_one("#__VIEWSTATE")["value"]
        payload_data["__EVENTVALIDATION"] = soup.select_one("#__EVENTVALIDATION")["value"]

    这段代码使用 requests.Session() 创建一个会话,以便在后续的请求中保持 Cookie 等信息。然后,使用 BeautifulSoup 解析 HTML,通过 CSS 选择器 soup.select_one("#__VIEWSTATE")["value"] 提取 __VIEWSTATE 和 __EVENTVALIDATION 的值。

  3. 构造 POST 请求

    Cogram
    Cogram

    使用AI帮你做会议笔记,跟踪行动项目

    下载

    构造一个字典,包含需要 POST 的数据。除了 __VIEWSTATE 和 __EVENTVALIDATION,可能还需要包含其他参数,例如 __EVENTTARGET、控件的 ID 等。这些参数通常可以在开发者工具的 Network 选项卡中找到。

    payload_data = {
        "__EVENTTARGET": "ReportViewer1$_ctl9$Reserved_AsyncLoadTarget",
        "__VIEWSTATE": "",
        "__VIEWSTATEGENERATOR": "4B866612",
        "__EVENTVALIDATION": "",
        "ReportViewer1:_ctl11": "standards",
        "ReportViewer1:AsyncWait:HiddenCancelField": "False",
        "ReportViewer1:ToggleParam:collapse": "false",
        "ReportViewer1:_ctl7:collapse": "false",
        "ReportViewer1:_ctl9:VisibilityState:_ctl0": "None",
        "ReportViewer1:_ctl9:ReportControl:_ctl4": "100"
    }

    请注意,payload_data 中的值需要根据实际情况进行调整。

  4. 发送 POST 请求并解析表格数据

    使用 requests.post() 方法发送 POST 请求,并将构造好的数据作为参数传递。然后,使用 Pandas 库的 read_html() 方法解析返回的 HTML 源码,提取表格数据。

    import pandas as pd
    from io import StringIO
    
    with requests.Session() as s:
        soup = BeautifulSoup(s.get(url).text, "lxml")
    
        # Get the viewstate and eventvalidation values first
        payload_data["__VIEWSTATE"] = soup.select_one("#__VIEWSTATE")["value"]
        payload_data["__EVENTVALIDATION"] = soup.select_one("#__EVENTVALIDATION")["value"]
    
        # Now the table should be in the source HTML
        table_data = s.post(url, data=payload_data)
    
        # Do some pandas magic to get the table data
        df = pd.read_html(StringIO(table_data.text))[-3]
        df = df.drop(df.columns[0], axis=1)
        df.dropna(inplace=True)
        df.columns = df.iloc[0]
        df = df.iloc[1:]
        print(tabulate(df, headers='keys', tablefmt='psql', showindex=False))

    pd.read_html() 方法会返回一个包含所有表格数据的列表。根据实际情况,选择正确的表格索引。然后,对表格数据进行清洗,例如删除不需要的列、删除空行、设置列名等。

  5. 数据清洗和格式化

    根据实际需求,对提取到的表格数据进行清洗和格式化。例如,删除不需要的列、删除空行、修改数据类型等。

注意事项

  • User-Agent: 某些网站会检查 User-Agent,可以设置请求头模拟浏览器访问。
  • Cookies: 有些网站依赖 Cookies 来跟踪会话,需要正确处理 Cookies。requests.Session() 可以方便地管理 Cookies。
  • 动态参数: __VIEWSTATE 和 __EVENTVALIDATION 等参数可能会动态变化,每次请求前都需要重新获取。
  • 错误处理: 添加适当的错误处理机制,例如捕获 requests.exceptions.RequestException 异常。
  • 网站协议: 遵守网站的robots.txt协议,尊重网站的爬取规则。

总结

本文介绍了一种从 ASP.NET 网站抓取表格数据的高效方法,通过模拟 POST 请求直接获取包含表格数据的 HTML 源码,避免了使用 Selenium 的开销。结合 BeautifulSoup 和 Pandas 库,可以方便地解析和提取表格数据。在实际应用中,需要根据目标网站的具体情况进行调整,例如修改 POST 数据、处理 Cookies 等。

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
css
css

css是层叠样式表,用来表现HTML或XML等文件样式的计算机语言,不仅可以静态地修饰网页,还可以配合各种脚本语言动态地对网页各元素进行格式化。php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

500

2023.06.15

css居中
css居中

css居中:1、通过“margin: 0 auto; text-align: center”实现水平居中;2、通过“display:flex”实现水平居中;3、通过“display:table-cell”和“margin-left”实现居中。本专题为大家提供css居中的相关的文章、下载、课程内容,供大家免费下载体验。

261

2023.07.27

css如何插入图片
css如何插入图片

cssCSS是层叠样式表(Cascading Style Sheets)的缩写。它是一种用于描述网页或应用程序外观和样式的标记语言。CSS可以控制网页的字体、颜色、布局、大小、背景、边框等方面,使得网页的外观更加美观和易于阅读。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

731

2023.07.28

css超出显示...
css超出显示...

在CSS中,当文本内容超出容器的宽度或高度时,可以使用省略号来表示被隐藏的文本内容。本专题为大家提供css超出显示...的相关文章,相关教程,供大家免费体验。

534

2023.08.01

css字体颜色
css字体颜色

CSS中,字体颜色可以通过属性color来设置,用于控制文本的前景色,字体颜色在网页设计中起到很重要的作用,具有以下表现作用:1、提升可读性;2、强调重点信息;3、营造氛围和美感;4、用于呈现品牌标识或与品牌形象相符的风格。

748

2023.08.10

什么是css
什么是css

CSS是层叠样式表(Cascading Style Sheets)的缩写,是一种用于描述网页(或其他基于 XML 的文档)样式与布局的标记语言,CSS的作用和意义如下:1、分离样式和内容;2、页面加载速度优化;3、实现响应式设计;4、确保整个网站的风格和样式保持统一。

594

2023.08.10

css三角形怎么写
css三角形怎么写

CSS可以通过多种方式实现三角形形状,本专题为大家提供css三角形怎么写的相关教程,大家可以免费体验。

556

2023.08.21

css设置文字颜色
css设置文字颜色

CSS(层叠样式表)可以用于设置文字颜色,这样做有以下好处和优势:1、增加网页的可视化效果;2、突出显示某些重要的信息或关键字;3、增强品牌识别度;4、提高网页的可访问性;5、引起不同的情感共鸣。

387

2023.08.22

桌面文件位置介绍
桌面文件位置介绍

本专题整合了桌面文件相关教程,阅读专题下面的文章了解更多内容。

0

2025.12.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Sass 教程
Sass 教程

共14课时 | 0.7万人学习

Bootstrap 5教程
Bootstrap 5教程

共46课时 | 2.7万人学习

CSS教程
CSS教程

共754课时 | 17.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号