尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

python 爬取 小说

python 爬取 小说 # 要导入包 pip install BeautifulSoup from bs4 import BeautifulSoup import requests # 网址 url https://www.qqxs.net/0/820/ # 头部信息在请求头中寻找 headers {User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/100.0.4896.75 Safari/537.36 Edg/100.0.1185.36} # 通过网址和请求头请求网址 re requests.get(url,headers headers) # 获取网址数据包 soup BeautifulSoup(re.content,html.parser) # 找到数据包对应标签下数据 soup_list soup.find(div,class_book_list book_list2) title_listsoup_list.find_all(a) # 遍历数据 for i in range(2): # 获取数据中文本 list_title title_list[i].get_text(stripTrue) # 这里是网址请求头我找的这个网址跳转小说是在网页跳转后没有显示全部网址所以我把网址请求头给加进去了 url_title_head https://www.qqxs.net/ # 这里获取点击标题跳转小说章节后的网址 title_url url_title_headtitle_list[i].get(href) # 获取小说章节网址后重新请求网址 re_article requests.get(title_url, headersheaders) soup_article BeautifulSoup(re_article.content, html.parser) # 找到小说文字 a_list soup_article.select(article.font_max) # 然后就可以遍历下载你通过小说标题查找的小说章节了 print(a_list) for j in a_list: # 获取数据中文本 list_article j.get_text(stripTrue) # 通过open函数写入文件标题文件格式写入文件不加地址的话默认本文件夹字体设置一下不然会乱码的 with open(list_title.text,modea,encodingutf-8) as f: # 然后就可以写入文件啦 f.write(list_article)
返回列表