类 BaseTradApplicationTest

  • 所有已实现的接口:
    Starter

    public class BaseTradApplicationTest
    extends TradApplication
    最基本的爬虫实例 基本流程: 1.首先需要继承AbstractStarter的子实现类 2.然后创建本类实例 3.加入爬虫种子 4.配置对该种子请求时的请求行,请求头,请求体(参数),以及HTTP代理,以及其他自定义信息 5.调用start方法 6.对爬取结果进行处理,主要包括将数据流保存为图片等静态资源,从html中获取文本信息存入数据库,从html中获取URL存入page,为下次爬取做准备

    执行本程序可以看见完整的生命周期:(三个生命周期均使用注解支持,注解只能使用在Application的子类中) 我们需要关注的只有三个: 1.before 2.deal 3.after 最常用到的也就只有deal一个,我们保存数据,以及提取URL,为下次爬取做的一切准备均在此处处理

    deal方法可以任意,但是注解必须为@Deal,我们也可以使用@Match注解。@Match是加强版的@Deal注解: 可以使用Match注解匹配正则表达式,匹配type类型,匹配响应码。比如: 一系列URL有相同特性,比如都是文章内容,他们的HTML结构都一样,因此可以走相同逻辑进行解析,此时可以使用type分类 同时,文章的URL可能有类似之处,可以使用正则表达式直接分类。 此外,如果遇到302响应码的请求,我们可以统一处理让他重新发起请求等等。

    作者:
    jiangqiang
    • 构造器详细资料

      • BaseTradApplicationTest

        public BaseTradApplicationTest()
    • 方法详细资料

      • before

        public void before()
      • deal

        public void deal​(Page page)
      • after

        public void after()
      • main

        public static void main​(String[] args)