使用 Scrapy 框架对重复的 url 无法获取数据,dont_filter=True
创始人
2024-11-21 07:06:36
0

 场景:代码没有报错,而且确定 xpath 表达式正确解析。

可能的原因是:你使用了 Scrapy 对重复的 url 进行请求。

Scrapy 内置了重复过滤功能,默认情况下该功能处于打开状态。

如下实例,parse2 无法被调用:

import scrapy  class ExampleSpider(scrapy.Spider):     name ="test"     # allowed_domains = ["https://www.baidu.com/"]      start_urls = ["https://www.baidu.com/"]      def parse(self,response):         yield scrapy.Request(self.start_urls[0],callback=self.parse2)      def parse2(self, response):         print(response.url)

Scrapy 在进入 parse 时,会默认请求一次 start_urls[0],而当你在 parse 中又对 start_urls[0] 进行请求时,Scrapy 底层会默认过滤掉重复的 url,不会对该请求进行提交,这就是为什么 parse2 不被调用的原因。

解决方法:

添加 dont_filter=True 参数,这样 Scrapy 就不会过滤掉重复的请求。

import scrapy  class ExampleSpider(scrapy.Spider):     name ="test"     # allowed_domains = ["https://www.baidu.com/"]      start_urls = ["https://www.baidu.com/"]      def parse(self,response):         yield scrapy.Request(self.start_urls[0],callback=self.parse2,dont_filter=True)      def parse2(self, response):         print(response.url)

此时,parse2 会被正常调用。

相关内容

热门资讯

推荐十款!蜀山四川智能辅助插件... 推荐十款!蜀山四川智能辅助插件下载-真的是有外挂(辅助)器(有挂秘诀);详细蜀山四川智能辅助插件下载...
玩家必备科普!四川熊猫辅助器-... 玩家必备科普!四川熊猫辅助器-真的有外挂(辅助)助手(有挂助手);是一款可以让一直输的玩家,快速成为...
必看攻略!pokermaste... 《必看攻略!pokermaster辅助器-是有外挂(辅助)助手(证实有挂)》 pokermaster...
科技通报!九九山城辅助-有外挂... 科技通报!九九山城辅助-有外挂(辅助)插件(有挂存在);超受欢迎的九九山城辅助稳赢小游戏,经典的九九...
攻略讲解!微乐微信小程序辅助软... 攻略讲解!微乐微信小程序辅助软件-真的是有外挂(辅助)助手(有挂攻略);微乐微信小程序辅助软件最新软...
玩家必看科普!朋朋政和麻为什么... 玩家必看科普!朋朋政和麻为什么一直输-真的有外挂(辅助)插件(有挂规律)是一款可以让一直输的玩家,快...
新手必备!wepoker免费透... 新手必备!wepoker免费透视-是有外挂(辅助)app(竟然有挂);一、wepoker免费透视AI...
玩家亲测!广东雀神挂件去那买-... 您好:广东雀神挂件去那买这款游戏可以开挂的,确实是有挂的,很多玩家在这款游戏中打牌都会发现很多用户的...
实测发现!吉安中至小程序辅助-... 实测发现!吉安中至小程序辅助-真的有外挂(辅助)软件(有挂实锤);吉安中至小程序辅助是一项吉安中至小...
实测揭晓!wejoker辅助软... 实测揭晓!wejoker辅助软件-真的是有外挂(辅助)器(有挂教程);wejoker辅助软件最新软件...