首页 > 运维 > linux运维 > 正文

magical_spider远程采集方案

看不見的法師
发布: 2025-07-19 09:26:01
原创
1016人浏览过

一个神奇的蜘蛛?项目,适用于数据采集任务,源码结构简洁明了。

magical_spider远程采集方案magical_spider远程采集方案magical_spider远程采集方案index页面示例:

magical_spider远程采集方案---

项目地址https://github.com/lixi5338619/magical_spider


使用指南1、配置settings.py,启动flask服务

2、参考demo文件夹中的代码进行测试,主要通过runflow.py运行。

代码语言:javascript代码运行次数:0运行复制```javascript import requestshost = 'http://127.0.0.1:5000'def magical_start(project_name,base_url = 'https://www.php.cn/link/b6f05a7baab2fe0eea07e59bd5b0b317'): # 1、创建浏览器并选择session_id result = requests.post(f'{host}/create',data={'name':project_name,'url':base_url}).json() session_id,process_url = result['session_id'],result['process_url'] return session_id,process_urldef magical_request(session_id,process_url,request_url): # 2、请求浏览器_xhr data = {'session_id':session_id,'process_url':process_url, 'request_url':request_url,'request_type':'get'} result = requests.post(f'{host}/xhr',data=data).json() return result['result']def magical_close(session_id,process_url,process_name): # 4、关闭浏览器 close_data = {'session_id':session_id,'process_url':process_url,'process_name':process_name} requests.post(f'{host}/close',data=close_data).json()

3、测试代码
<p>GET请求</p><p>代码语言:javascript代码运行次数:0<svg fill="none" height="16" viewbox="0 0 16 16" width="16" xmlns="<a href="https://www.php.cn/link/c9041cfd2a40932691855abd98fd219a">http://www.w3.org/2000/svg"><path</a> d="M6.66666 10.9999L10.6667 7.99992L6.66666 4.99992V10.9999ZM7.99999 1.33325C4.31999 1.33325 1.33333 4.31992 1.33333 7.99992C1.33333 11.6799 4.31999 14.6666 7.99999 14.6666C11.68 14.6666 14.6667 11.6799 14.6667 7.99992C14.6667 4.31992 11.68 1.33325 7.99999 1.33325ZM7.99999 13.3333C5.05999 13.3333 2.66666 10.9399 2.66666 7.99992C2.66666 5.05992 5.05999 2.66659 7.99999 2.66659C10.94 2.66659 13.3333 5.05992 13.3333 7.99992C13.3333 10.9399 10.94 13.3333 7.99999 13.3333Z" fill="currentcolor"></path></svg>运行<svg fill="none" height="16" viewbox="0 0 16 16" width="16" xmlns="<a href="https://www.php.cn/link/c9041cfd2a40932691855abd98fd219a">http://www.w3.org/2000/svg"><path</a> clip-rule="evenodd" d="M4.5 15.5V3.5H14.5V15.5H4.5ZM12.5 5.5H6.5V13.5H12.5V5.5ZM9.5 2.5H3.5V12.5H1.5V0.5H11.5V2.5H9.5Z" fill="currentcolor" fill-rule="evenodd"></path></svg>复制<code>javascript from demo.runflow import magical_start,magical_request,magical_closeproject_name = 'cnipa'base_url = 'https://www.cnipa.gov.cn'session_id,process_url = magical_start(project_name,base_url)print(len(magical_request(session_id, process_url,'https://www.cnipa.gov.cn/col/col57/index.html')))magical_close(session_id,process_url,project_name)</code>
登录后复制

POST请求

代码语言:javascript代码运行次数:0运行复制javascript from demo.runflow import magical_start,magical_request,magical_closeimport jsonproject_name = 'chinadrugtrials'base_url = 'http://www.chinadrugtrials.org.cn'session_id,process_url = magical_start(project_name,base_url)data = {"id": "","ckm_index": "","sort": "desc","sort2": "","rule": "CTR","secondLevel": "0","currentpage": "2","keywords": "","reg_no": "","indication": "","case_no": "","drugs_name": "","drugs_type": "","appliers": "","communities": "","researchers": "","agencies": "","state": ""}formdata = json.dumps(data)print(magical_request(session_id=session_id, process_url=process_url, request_url='https://www.php.cn/link/44f95c37a24495521a98b63f0bbf4268', request_type='post',formdata=formdata ))magical_close(session_id,process_url,project_name)

<code></p><p>4、index页面可以查看和管理当前运行中的任务,同时可以查看系统的内存和磁盘使用情况。</p><p>5、demo文件夹包含任务流程汇总runflow.py,以及抖音和药监局的案例,提供了单任务和多任务的示例。</p>
                    <div class="aritcle_card">
                        <a class="aritcle_card_img" href="/xiazai/code/11201">
                            <img src="https://img.php.cn/upload/webcode/000/000/014/176528880391936.png" alt="BJXSHOP网上购物系统 - 书店版">
                        </a>
                        <div class="aritcle_card_info">
                            <a href="/xiazai/code/11201">BJXSHOP网上购物系统 - 书店版</a>
                            <p>BJXSHOP购物管理系统是一个功能完善、展示信息丰富的电子商店销售平台;针对企业与个人的网上销售系统;开放式远程商店管理;完善的订单管理、销售统计、结算系统;强力搜索引擎支持;提供网上多种在线支付方式解决方案;强大的技术应用能力和网络安全系统     BJXSHOP网上购物系统 - 书店版,它具备其他通用购物系统不同的功能,有针对图书销售而进行开发的一个电子商店销售平台,如图书ISBN,图书目录</p>
                            <div class="">
                                <img src="/static/images/card_xiazai.png" alt="BJXSHOP网上购物系统 - 书店版">
                                <span>0</span>
                            </div>
                        </div>
                        <a href="/xiazai/code/11201" class="aritcle_card_btn">
                            <span>查看详情</span>
                            <img src="/static/images/cardxiayige-3.png" alt="BJXSHOP网上购物系统 - 书店版">
                        </a>
                    </div>
                <hr /><p>linux部署1.安装chrome(选择安装位置) yum install <a href="https://www.php.cn/link/6b17d006a2ed6f12f07c7ea60b8002b5">https://www.php.cn/link/6b17d006a2ed6f12f07c7ea60b8002b5</a></p><p>2.检查chrome版本 google-chrome --version</p><p>3.安装对应版本的chromedriver_linux64 例如,我的chrome版本是104.0.5112.79 wget <a href="https://www.php.cn/link/5bb5f8d030f5e6e4b6d137c6990f0772">https://www.php.cn/link/5bb5f8d030f5e6e4b6d137c6990f0772</a></p><p>4.解压chromedriver unzip chromedriver_linux64</p><p>5.授权chromedriver chmod 777 chromedriver</p><p>6.修改项目代码settings.py中的chromedriver路径</p><p>7.安装python依赖并启动flask项目</p><p>Python依赖:flask、sqlite3、selenium、websockets、opencv-python、numpyflask启动方式:python3 server.py8.开启服务器端口访问权限</p><p>9.运行项目测试
登录后复制

以上就是magical_spider远程采集方案的详细内容,更多请关注php中文网其它相关文章!

最佳 Windows 性能的顶级免费优化软件
最佳 Windows 性能的顶级免费优化软件

每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。

下载
来源:php中文网
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
开源免费商场系统广告
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号