第77章 爬虫抓取的第一份数据:教辅价格 首页

字体:      护眼 关灯

上一页 目录 下一页

第77章 爬虫抓取的第一份数据:教辅价格(2/6)

器的“开发者工具”(F12)查看京东搜索“初中数学教辅”的结果页。密密麻麻的HTML标签让他眼花缭乱,但通过“检查元素”功能点击具体的书名、价格,他逐渐锁定了数据所在的标签类别和class名称。这是一个需要耐心和细心的“侦探”工作。

第二、三天:编写第一个爬虫脚本(京东)。

他先尝试抓取单页数据。代码大致如下:

importrequests

frombs4importBeautifulSoup

importpandasaspd

importtime

headers={'User-Agent':'Mozilla/5.0...'}#模拟浏览器请求头

url='https://search.jd.com/...初中数学教辅...'#搜索URL

response=requests.get(url,headers=headers)

soup=BeautifulSoup(response.text,'html.parser')

books=[]

foriteminsoup.find_all('div',class_='gl-i-wrap'):#根据实际class调整

try:

title=item.find('div',class_='p-name').em.get_text(strip=True)

price=item.find('div',class_='p-price').strong.i.get_text()

shop=item.find('div',class_='p-shop').span.get_text(strip=True)ifitem.find('div',class_='p-shop')else'未知'

#评价数有时在另一个标签里,需要更复杂的查找

commit=item.find('div',class_='p-commit').strong.get_text(strip=True)ifitem.find('div',class_='p-c

本章还未完,请点击下一页继续阅读

上一页 目录 下一页