所有类
-
所有类 接口概要 类概要 枚举概要 注释类型概要 类 说明 After App Application AutoBaseApplicationTest 最基本的爬虫实例 本文讲解基本处理实例 Page对象封装了请求响应结果,他本身也是爬虫的子类 可以直接取出html内容,以及字节流保存为文件等等BaseApplicationTest 最基本的爬虫实例 基本流程: 1.首先需要继承Application类 2.然后创建本类实例 3.加入爬虫种子 4.配置对该种子请求时的请求行,请求头,请求体(参数),以及HTTP代理,以及其他自定义信息 5.调用start方法 6.对爬取结果进行处理,主要包括将数据流保存为图片等静态资源,从html中获取文本信息存入数据库,从html中获取URL存入next,为下次爬取做准备Bean Before CallMethodHelper ClassUtil 获取指定包下的类,获取指定包下带有指定注解的类。CommonInterCeptor Config Crawler 此对象用于作为参数发起HTTP请求,同时构造新的Page对象Deal 处理每一个Page对象,公共逻辑DealApplicationTest 最基本的爬虫实例 本文讲解基本处理实例 Page对象封装了请求响应结果,他本身也是爬虫的子类 可以直接取出html内容,以及字节流保存为文件等等DocumentUtil FileUtil Filter Match 处理每一个Page对象,值和Crawler.type相同时的执行逻辑。Next 存取从page中提取的下一代爬虫的信息NextFilter OkHttpClientHelper Page 请求结束后的爬虫,此对象用于提取数据Record 存储所有种子 运行结束时保存RecordImpl 存储所有种子 运行结束时保存ReflectHelper RegExpUtil RequestMethod SaveApplicationTest StringUtil Test TestProxy