pagesize属性每页显示无穷数据_scrapy爬取云沃客项目外包网数据!
发布日期:2022-02-04 03:26:02
浏览次数:7
分类:技术文章
本文共 2900 字,大约阅读时间需要 9 分钟。
闲暇写一个外包网站的爬虫,万一你从这个外包网站弄点外快呢
数据分析
官方网址为 https://www.clouderwork.com/
Python资源共享群:484031800
进入全部项目列表页面,很容易分辨出来项目的分页方式
得到异步请求
Request URL:https://www.clouderwork.com/api/v2/jobs/search?ts=1546395904852&keyword=&budget_range=&work_status=&pagesize=20&pagenum=3&sort=1&scope=Request Method:GETStatus Code:200 OK
参数如下
ts:1546395904852 # 时间戳 keyword: # 搜索关键字,查找全部,使用空即可 budget_range: # 暂时无用 work_status: pagesize:20 # 每页数据量 pagenum:3 # 页码 sort:1 # 排序规则 scope:
下面就是拼接请求了,一下确定 request 相关参数
Accept:application/json, text/javascript, */*; q=0.01Accept-Encoding:gzip, deflate, brAccept-Language:zh-CN,zh;q=0.9Connection:keep-aliveCookie:Host:www.clouderwork.comReferer:https://www.clouderwork.com/jobs?keyword=User-Agent:Mozilla/5.0 你自己的UA QQBrowser/10.3.3006.400X-Requested-With:XMLHttpRequest
采用爬虫 scrapy
这个网站没有反爬措施,所以直接上就可以了
# -*- coding: utf-8 -*-import scrapyfrom scrapy import Requestimport timeimport jsonclass CloudeworkSpider(scrapy.Spider): name = 'cloudework' allowed_domains = ['www.clouderwork.com'] start_url = 'https://www.clouderwork.com/api/v2/jobs/search?ts={times}&keyword=&budget_range=&work_status=&pagesize={pagesize}&pagenum={pagenum}&sort=1&scope=' def start_requests(self): for page in range(1,353): yield Request(self.start_url.format(times=time.time(),pagesize=20,pagenum=page)) def parse(self, response): json_data = json.loads(response.text) for item in json_data["jobs"]: yield item
存储数据到 mongodb 中,合计爬取到 7000+ 数据
数据分析
从mongdo读取数据
import pymongoimport pandas as pdfrom pandas import Series,DataFrameimport matplotlib.pyplot as pltplt.rcParams['font.sans-serif']=['SimHei'] #用来正常显示中文标签plt.rcParams['axes.unicode_minus']=False #用来正常显示负号# 连接数据库client = pymongo.MongoClient("localhost",27017)cloud = client["cloud"]collection = cloud["cloudework"]# 加载数据data = DataFrame(list(collection.find()))
结果显示为 [7032 rows x 35 columns]
查看数据基本情况
使用直接 data.shape 可以查看一下数据的基本情况
查看一下工期的分布
periods = data.groupby(["period"]).size()x = periods.index y = periods.values plt.figure()plt.scatter(x,y, color="#03a9f4", alpha = 0.5) # 绘制图表plt.xlim((0, 360))plt.ylim((0, 2000))plt.xlabel("工期")plt.ylabel("项目数")plt.show()
可以看到数据散点集中在0〜50天
image
过滤一下40天以内的数据
periods = data.groupby(["period"]).size().reset_index(name="count")df = periods[periods["period"]<=40]x = df["period"]y = df["count"]plt.figure()plt.scatter(x,y,label='项目数折线',color="#ff44cc")plt.title("工期对应项目数")plt.xlim((0, 360))plt.ylim((0, 500))plt.show()
image
发现竟然有1天工期的任务,可以瞅瞅都是什么任务
periods = data.groupby(["period"]).size()data[data["period"]==1][["name","period"]]
image
果然比较简单唉~~不过也没有多少钱,有个急活1000¥
查看阅览量排行Top10
views = data["views_count"]top10 = views.sort_values(ascending=False)[:10]top10 = data[data.views_count.isin(top10.values)][["name","views_count","period","summary"]]top10
image
查阅一下开发模式
看一下什么类型的项目比较多???数据上反应,网络网站和APP最多了,所以这方面的技能的大神么,可以冲一波了
转载地址:https://blog.csdn.net/weixin_39626369/article/details/111666097 如侵犯您的版权,请留言回复原文章的地址,我们会给您删除此文章,给您带来不便请您谅解!
发表评论
最新留言
哈哈,博客排版真的漂亮呢~
[***.90.31.176]2024年04月12日 08时23分08秒
关于作者
喝酒易醉,品茶养心,人生如梦,品茶悟道,何以解忧?唯有杜康!
-- 愿君每日到此一游!
推荐文章
其他数字摘要算法实现
2019-05-01
非对称加密算法
2019-05-01
公钥和私钥生成规则
2019-05-01
私钥加密私钥解密
2019-05-01
私钥加密公钥解密
2019-05-01
获取私钥key对象
2019-05-01
获取公钥对象
2019-05-01
什么是数字签名
2019-05-01
数字签名原理
2019-05-01
锁的释放流程-ReentrantLock.unlock
2019-05-01
锁的释放流程-ReentrantLock.tryRelease
2019-05-01
锁的释放流程-unparkSuccessor
2019-05-01
ConcurrentHashMap的源码分析-tryPresize
2019-05-01
生产者消费者的实际使用
2019-05-01
阻塞队列的使用案例-注册成功后增加积分
2019-05-01
序列化的高阶认识-Transient 关键字
2019-05-01
序列化的高阶认识-绕开 transient 机制的办法
2019-05-01
Java 序列化的一些简 单总结
2019-05-01
分布式架构下常见序列化技术-了解序列化的发展
2019-05-01
Java判断字符串是否为数字(浮点类型也包括)
2019-05-01