色综合图-色综合图片-色综合图片二区150p-色综合图区-玖玖国产精品视频-玖玖香蕉视频

您的位置:首頁技術文章
文章詳情頁

python - Scrapy ItemLoader數據清洗疑問

瀏覽:138日期:2022-06-30 08:28:51

問題描述

在使用scrapy抓取數據時,利用itemloader這個類,使用selector取出的值為空時,進入scrapy.Field()里調用filter(),selector取值不為空的確返回'有值',如果selector取出[]或'',那么value進入filter()之后,并不會返回'無值'

def filter(value): if value:return '有值' else:return '無值' # 下面就簡寫了,熟悉的應該能看的懂 scrapy.Field(filter())

有什么辦法將抓取為空的值,經過filyer()之后變成'無值'

問題解答

回答1:

謝邀~不太了解Scrapy,所以題主這個我不太好說我用PHP自己寫的爬蟲大體思路是:1.先是根據正則和一些循環,把要收集的頁面放到隊列里,按類別分類,例如分頁的列表頁一個隊列,列表里的數據內容頁一個隊列。2.然后利用xpath來爬取相關內容頁的數據,爬取的過程中對一些爬取到的數據進行如題主所需的那樣進行處理。3.組裝數據,按照自己所需的標準保存數據。

大體就是這樣,我絕對大部分爬蟲框架也大概都是這種思路吧,無非是在此基礎上增加了,反爬機制,多線程,多進程,增量爬取等等功能。所以,題主找到你這個框架的爬取數據那里進行處理或組裝數據的地方進行處理都行。

標簽: Python 編程
相關文章:
主站蜘蛛池模板: 日韩在线观看一区二区三区 | 亚洲精品一区二区观看 | 亚洲精品自拍视频 | 欧美日本亚洲国产一区二区 | 欧美日韩在线视频一区 | 毛片大片免费看 | 免费在线观看一区二区 | 国产在亚洲线视频观看 | 久久91精品综合国产首页 | 怡红院美国十次成人影院 | 精品国产一区二区三区成人 | 精品国产97在线观看 | 在线播放 亚洲 | 亚洲天堂2017| 91精品啪在线观看国产91九色 | 日韩一级片在线播放 | 九九精品视频一区在线 | 国内亚州视频在线观看 | 男女午夜爽爽 | 深夜福利网站在线观看 | 日韩在线视频免费 | 可以免费看黄的网站 | 日韩看片 | 亚洲国产欧美日韩精品一区二区三区 | 香蕉一区二区三区观 | 一级女性全黄久久生活片 | 美女黄视频免费观看 | 亚洲成人h | 国产免费人成在线看视频 | 精品亚洲视频在线 | 手机看片免费基地 | 国产成人综合亚洲亚洲欧美 | 欧美第一网站 | 欧美资源在线观看 | 亚洲深夜福利视频 | 欧美视频三区 | 国产综合视频在线观看一区 | 亚洲国产精品自在现线让你爽 | 欧美视频精品一区二区三区 | 国产免费一级在线观看 | 日本综合欧美一区二区三区 |