类的使用
xin.jiangqiang.entities.Crawler
-
-
xin.jiangqiang.app中Crawler的使用
声明为Crawler的xin.jiangqiang.app中的字段 修饰符和类型 字段 说明 protected CrawlerAbstractStarter. crawler返回Crawler的xin.jiangqiang.app中的方法 修饰符和类型 方法 说明 CrawlerAbstractStarter. addSeed(String url)创建时子类爬虫深度会自动+1CrawlerAbstractStarter. getCrawler()已过时。参数类型为Crawler的xin.jiangqiang.app中的方法 修饰符和类型 方法 说明 abstract RunnableAbstractStarter. getTask(Crawler crawler)RunnableSeleniumApplication. getTask(Crawler crawler)RunnableTradApplication. getTask(Crawler crawler)protected voidSeleniumApplication. init(WebHandlerManager webHandlerManager, Crawler crawler)此方法专门用于子类重写,方便实现自定义功能,比如爬虫启动前模拟登录操作,获取cookie selenium模式独有方法参数类型为Crawler的xin.jiangqiang.app中的构造器 构造器 说明 Task(Crawler crawler)Task(Crawler crawler) -
xin.jiangqiang.entities中Crawler的使用
xin.jiangqiang.entities中Crawler的子类 修饰符和类型 类 说明 classPage请求结束后的爬虫,此对象用于提取数据返回Crawler的xin.jiangqiang.entities中的方法 修饰符和类型 方法 说明 CrawlerCrawler. addSeed(String url)创建时子类爬虫深度会自动+1CrawlerCrawler. initDataFromCrawler(Crawler crawler)1.CrawlerCrawler. setBodys(Map<String,String> bodys)CrawlerCrawler. setConfigs(Map<String,String> configs)CrawlerCrawler. setData(Map<String,String> others)CrawlerCrawler. setHeaders(Map<String,String> headers)CrawlerCrawler. setLines(Map<String,String> lines)CrawlerCrawler. setMethod(RequestMethod method)参数类型为Crawler的xin.jiangqiang.entities中的方法 修饰符和类型 方法 说明 static PagePage. getPage(Crawler crawler, Integer responseCode, String contentType, byte[] content, Charset charset)okhttp请求之后通过crawler创建page page和crawler的其余属性一致static PagePage. getPage(Crawler crawler, Integer responseCode, String contentType, String html)selenium使用CrawlerCrawler. initDataFromCrawler(Crawler crawler)1. -
xin.jiangqiang.filter中Crawler的使用
参数类型为Crawler的xin.jiangqiang.filter中的方法 修饰符和类型 方法 说明 voidFilter. filter(Crawler crawler)voidNextFilter. filter(Crawler crawler)过滤掉每次请求后解析的URL中不需要的URL 可以在此方法实现去重,但是意义不大,不同的URL访问之后可以解析到相同的URL,因此在这里去重不是一个很好的办法 -
xin.jiangqiang.manage中Crawler的使用
返回Crawler的xin.jiangqiang.manage中的方法 修饰符和类型 方法 说明 CrawlerDbRecorder. getOne()CrawlerRAMRecorder. getOne()读写集合crawlersList 获取的同时需要删除存储的该爬虫实例(保证下一个线程不会取到同一个)CrawlerRecorder. getOne()取出未爬取的爬虫 取出后需要删除该爬虫返回变量类型为Crawler的类型的xin.jiangqiang.manage中的方法 修饰符和类型 方法 说明 List<Crawler>AbstractRecorder. getAll()List<Crawler>Recorder. getAll()查询所有未爬取的爬虫List<Crawler>AbstractRecorder. getErr()List<Crawler>Recorder. getErr()查询爬取失败的List<Crawler>AbstractRecorder. getSucc()List<Crawler>Recorder. getSucc()查询爬取成功的参数类型为Crawler的xin.jiangqiang.manage中的方法 修饰符和类型 方法 说明 voidDbRecorder. add(Crawler crawler)voidRAMRecorder. add(Crawler crawler)写集合crawlersList 不能添加重复的爬虫voidRecorder. add(Crawler crawler)存储未爬取的爬虫 需要去重处理voidDbRecorder. addErr(Crawler crawler)voidRAMRecorder. addErr(Crawler crawler)写集合errCrawlers 成功或失败后移除正在爬取列表中的对应爬虫voidRecorder. addErr(Crawler crawler)记录失败的voidDbRecorder. addSucc(Crawler crawler)voidRAMRecorder. addSucc(Crawler crawler)写集合succCrawlers 成功或失败后移除正在爬取列表中的对应爬虫voidRecorder. addSucc(Crawler crawler)记录爬取成功的类型变量类型为Crawler的xin.jiangqiang.manage中的方法参数 修饰符和类型 方法 说明 voidAbstractRecorder. addAll(List<Crawler> crawlers)voidRAMRecorder. addAll(List<Crawler> crawlers)写集合crawlersList 不能添加重复的爬虫voidRecorder. addAll(List<Crawler> crawlers)存储未爬取的爬虫 需要去重处理 -
xin.jiangqiang.net中Crawler的使用
参数类型为Crawler的xin.jiangqiang.net中的方法 修饰符和类型 方法 说明 PageOkHttpClientHelper. request(Crawler crawler) -
xin.jiangqiang.sample中Crawler的使用
参数类型为Crawler的xin.jiangqiang.sample中的方法 修饰符和类型 方法 说明 protected voidProxySeleniumApplicationTest. init(WebHandlerManager webHandlerManager, Crawler crawler)模拟登录获取cookie,将cookie放入种子中 -
xin.jiangqiang.selenium中Crawler的使用
参数类型为Crawler的xin.jiangqiang.selenium中的方法 修饰符和类型 方法 说明 org.openqa.selenium.WebDriverAbstractSeleniumHelper. getChromeDriver(Crawler crawler)org.openqa.selenium.WebDriverSeleniumHelper. getChromeDriver(Crawler crawler)org.openqa.selenium.WebDriverAbstractSeleniumHelper. getDriver(Crawler crawler)org.openqa.selenium.WebDriverSeleniumHelper. getDriver(Crawler crawler)org.openqa.selenium.WebDriverAbstractSeleniumHelper. getEdgeDriver(Crawler crawler)org.openqa.selenium.WebDriverSeleniumHelper. getEdgeDriver(Crawler crawler)org.openqa.selenium.WebDriverAbstractSeleniumHelper. getFirefoxDriver(Crawler crawler)org.openqa.selenium.WebDriverSeleniumHelper. getFirefoxDriver(Crawler crawler)org.openqa.selenium.WebDriverAbstractSeleniumHelper. getInternetExplorerDriver(Crawler crawler)org.openqa.selenium.WebDriverSeleniumHelper. getInternetExplorerDriver(Crawler crawler)org.openqa.selenium.WebDriverAbstractSeleniumHelper. getOperaDriver(Crawler crawler)org.openqa.selenium.WebDriverSeleniumHelper. getOperaDriver(Crawler crawler)abstract PageAbstractSeleniumHelper. request(WebHandler webHandler, Crawler crawler)PageSeleniumHelper. request(WebHandler driver, Crawler crawler)PageSeleniumHelperDefaultImpl. request(WebHandler webHandler, Crawler crawler) -
xin.jiangqiang.selenium.webdriver中Crawler的使用
参数类型为Crawler的xin.jiangqiang.selenium.webdriver中的方法 修饰符和类型 方法 说明 static WebHandlerManagerWebHandlerManager. getInstance(Config config, SeleniumHelper seleniumHelper, Crawler crawler) -
xin.jiangqiang.util中Crawler的使用
参数类型为Crawler的xin.jiangqiang.util中的方法 修饰符和类型 方法 说明 static voidCrawlerUtil. clearNextCrawler(Crawler crawler)清空下一代种子
-