通过url解析网址title和logo图片
import org.jsoup.Jsoup; import org.jsoup.nodes.Document; import org.jsoup.select.Elements; import java.util.regex.Matcher; import java.util.regex.Pattern;//获取logo图片 一些大型网址可以通过url/favicon.ico //比如https://www.qq.com/favicon.ico 这种就存在一个问题有些网址是没有配置就获取不到 //通过url解析网址title和logo public MapString,String getUrlTilte(String url){ String tilte; MapString,String mapnew HashMapString,String(); try { //还是一样先从一个URL加载一个Document对象。 Document doc Jsoup.connect(url).get(); Elements links doc.select(head); Elements titlelinkslinks.get(0).select(title); tiltetitlelinks.get(0).text(); log.info(tilte{},tilte); map.put(tilte,tilte); Elements imgs doc.select(img); //获取网址第一张图片 Elements titlelinkimgs.get(0).select(img); String logo; String imgtitlelink.get(0).toString(); Pattern p_image; Matcher m_image; ListString pics new ArrayListString(); String regEx_img img.*src\\s*\\s*(.*?)[^]*?; p_image Pattern.compile(regEx_img, Pattern.CASE_INSENSITIVE); m_image p_image.matcher(img); while (m_image.find()) { img img , m_image.group(); Matcher m Pattern.compile(src\\s*\\s*\?(.*?)(\||\\s)).matcher(img); while (m.find()) { logom.group(1); } } map.put(logo,logo); log.info(logo{},logo); }catch(Exception e) { log.error(通过url{} 网址解析title和logo 异常,url,e); e.printStackTrace(); } return map; }