集团官网
  • 国家级全民数字素养与技能培训基地
  • 河南省第一批产教融合型企业建设培育单位
  • 郑州市数字技能人才(码农)培养评价联盟

如何利用Java爬取网站数据?

编辑:云和数据 日期:2022-11-29 14:17

1.Jsoup介绍

 

– 官网文档:https://jsoup.org

– Jsoup 是一款Java 的HTML解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出和操作数据。

2. Jsoup快速入门

– 获取网页标题

String url = "https://search.jd.com/Search?keyword=手机&wq=手机&page=1";Document document = Jsoup.connect(url).get();String title = document.select("title").text();System.out.println(title);```

– 运行效果:手机 – 商品搜索 – 京东

3. 网站数据分析

3.1 分析网站的访问地址

– 以京东商城为例,商品分页列表的url地址,需要带如下几个参数,因此,在发送http请求时,需要携带正确的参数。

– URL:https://search.jd.com/Search?keyword=手机&wq=手机&page=1

3.2 分析网站的页面结构

– 通过浏览器的开发者工具,可以分析出页面中我们需要的html结构。

– 可以看出,我们需要的商品数据,封装在一个id=J_goodsList的div标签中,我们可以方便的通过DOM解析出这块数据。

4. 实战实现过程

– 获取第1页的商品基本数据

public static void main(String[] args) throws Exception {    //第1页地址    String url = "https://search.jd.com/Search?keyword=手机&wq=手机&page=1";    //发送http请求    Document document = Jsoup.connect(url).get();    //在id=J_goodsList的div下,获取所有带有data-sku属性的li标签    Elements lis = document.select("div[id=J_goodsList] li[data-sku]");    lis.forEach(            li -> {                //获取商品sku                String sku = li.attr("data-sku");                //获取商品name                String name = li.select("div[class='p-name p-name-type-2'] a em").text();                //获取商品图片地址                String img = li.select("div[class=p-img] a img[data-lazy-img]").attr("data-lazy-img");                               System.out.println(String.format("%s, %s, %s", sku, name, img));            }    );}

– 效果预览

1665718155423_1.jpg

– 改造为分页获取

public static void main(String[] args) throws Exception {    //第N页地址    String url = "https://search.jd.com/Search?keyword=手机&wq=手机&page=" + i;    //发送http请求    Document document = Jsoup.connect(url).get();    //在id=J_goodsList的div下,获取所有带有data-sku属性的li标签    Elements lis = document.select("div[id=J_goodsList] li[data-sku]");    lis.forEach(            li -> {                //获取商品sku                String sku = li.attr("data-sku");                //获取商品name                String name = li.select("div[class='p-name p-name-type-2'] a em").text();                //获取商品图片地址                String img = li.select("div[class=p-img] a img[data-lazy-img]").attr("data-lazy-img");                System.out.println(String.format("%s, %s, %s", sku, name, img));            }    );}

相关内容

抢先一步 鸿蒙(HarmonyOS)应用开发者高级认证 免费考! 适合人群计算机相关专业在校生(技师、中职、高职、本科、研究生)对鸿蒙(HarmonyOS)有兴趣的非计算机相关专业在校生目前正在从事移动应用的开发者目前正在从事计算机行业相关的人计算机专业高校老师所有对鸿蒙(HarmonyOS)有兴趣的人 培训方案掌握鸿蒙的核心概念和端云一体化开发、... 什么是Java的多态性(polymorphism)?它有哪些不同的形式? 多态性是Java面向对象编程的一个重要概念,它允许不同的对象以一致的方式响应同一个方法调用,具体表现为对象在运行时可以表现出多个不同的形态。多态性主要有两种不同的形式:编译时多态性(静态多态性)和运行时多态性(动态多态性)。1. 编译时多态性(静态多态性):   ... 如何学习和搭建Hadoop开发环境? Hadoop是大数据处理领域的重要平台,能够处理和分析大量数据。为了有效地利用Hadoop,我们需要学习其基础知识,并正确搭建开发环境。下面是详细的学习和搭建指南。一、学习Hadoop基础掌握基础概念和原理Hadoop主要由HDFS和MapReduce两部分组成。HDFS是分布式文件系统,Ma... UI 设计学习如何进阶成为高手 我总结了六种方法,帮助你走出舒适区,提高技能,成长为自信且经验丰富的UI设计高手一位经验丰富的 UI 设计师,往往十分看中应用程序界面的吸引力和视觉刺激,确保满足用户期望和需求。但是,如果你已经在 UI 设计圈摸爬滚打多年,仍然没有出色的作品,那你极有可能是因为陷入了一个舒适圈,UI技能一直原... 在Java中Executor和Executors的区别? 在Java中,Executor和Executors都与线程池和并发执行有关,但它们是不同的概念和类。1.ExecutorExecutor是一个接口,位于java.util.concurrent包中,用于表示一个执行任务的执行器。它只定义了一个方法:void execute(Runnable c... String类型的常见命令有哪些? String类型,也就是字符串类型,是Redis中最简单的存储类型。其value是字符串,不过根据字符串的格式不同,又可以分为3类:string是普通字符串,int整数类型,可以做自增、自减操作,float浮点类型,可以做自增、自减操作。String的常见命令有:SET:添加或者修改已经存在的...