所有类
-
所有类 接口概要 类概要 枚举概要 注释类型概要 类 说明 AbstractRecorder 下面方法作为保留方法,暂时没有使用,但是后续可能会使用到 如果后续使用到下面方法可以通过子类覆盖AbstractSeleniumHelper AbstractStarter 定义开始爬取前,爬取完成后的基本流程After App AutoBaseTradApplicationTest 最基本的爬虫实例 本文讲解基本处理实例 Page对象封装了请求响应结果,他本身也是爬虫的子类 可以直接取出html内容,以及字节流保存为文件等等AutoFileTradApplicationTest 自动从maven仓库抓取文件并保存,小文件可以直接使用Page对象进行保存, 大文件应该直接从URL中进行下载文件。BaseTradApplicationTest 最基本的爬虫实例 基本流程: 1.首先需要继承AbstractStarter的子实现类 2.然后创建本类实例 3.加入爬虫种子 4.配置对该种子请求时的请求行,请求头,请求体(参数),以及HTTP代理,以及其他自定义信息 5.调用start方法 6.对爬取结果进行处理,主要包括将数据流保存为图片等静态资源,从html中获取文本信息存入数据库,从html中获取URL存入page,为下次爬取做准备Bean Before CallMethodHelper ClassUtil 获取指定包下的类,获取指定包下带有指定注解的类。CommonInterCeptor Config CookieUtil Crawler 定义公共属性和元数据CrawlerUtil DbRecorder 数据库记录器 保留类,暂时未实现Deal 处理每一个Page对象,公共逻辑, 和match的区别是:会匹配任意对象DealTradApplicationTest 最基本的爬虫实例 本文讲解基本处理实例 Page对象封装了请求响应结果,他本身也是爬虫的子类 可以直接取出html内容,以及字节流保存为文件等等DocumentUtil DriverUtil FileUtil Filter HttpUtil Match 处理每一个Page对象,值和Crawler.type相同时的执行逻辑。NextFilter OkHttpClientHelper Page 请求结束后的爬虫,此对象用于提取数据ProxySeleniumApplicationTest RAMRecorder 内存记录器,存储统计各个阶段的爬虫 此类所有方法同步,是限制并发的主要因素Recorder 记录各种爬取状态的爬虫ReflectHelper RegExpUtil RequestMethod SaveTradApplicationTest SeleniumApplication SeleniumHelper 创建驱动并且发送请求的接口SeleniumHelperDefaultImpl Starter 项目启动类接口StringUtil TestProxy TestSaveFile 从网络中保存图片演示TradApplication 此类用于爬取传统页面WebHandler 管理标签页 拥有一个单例的WebDriver,以及标签页句柄字符串 每一个实例都表示一个具体的标签页WebHandlerManager 单例模式 此对象用于维护一个List,存放标签页