python爬虫類はseleniumを利用して自動でページをめくってある魚のデータの構想を取ることを実現します。
基本的な考え方:
まず開発者ツールでデータを抽出するラベル列を見つけます。
data:image/s3,"s3://crabby-images/3edb4/3edb4f0a6c45c724ce8dd85449869304a811f064" alt=""
xpath位置決めを利用してデータを抽出する必要があるリスト
data:image/s3,"s3://crabby-images/b195b/b195b33c081958a193ee52a6edc957d6cfdd0a46" alt=""
その後、対応するデータを1つずつ抽出します。
data:image/s3,"s3://crabby-images/6c9f8/6c9f87021747d5bd897bcbf7642be542edf77760" alt=""
csvにデータを保存:
data:image/s3,"s3://crabby-images/87ef8/87ef8e3342132428a2b1a5d04d1a627e0e6c3421" alt=""
開発者ツールを使って次のページのボタンのあるラベルを見つけます。
data:image/s3,"s3://crabby-images/86407/864076104c39137cf0c90243c93f1279ba01d971" alt=""
このラベルオブジェクトをxpathで抽出して返します。
data:image/s3,"s3://crabby-images/dfec0/dfec06ea84ba2f4973a6b9192483d20ae4a7bc1a" alt=""
イベントを呼び出し、上記のプロセスを繰り返します。
data:image/s3,"s3://crabby-images/cb935/cb9359e6a151dd03a5cc9eaa34c3df062bac26e1" alt=""
最終効果図:
data:image/s3,"s3://crabby-images/86fe7/86fe7d77b64890192742414fd775f51a313ecbf6" alt=""
コード:
まず開発者ツールでデータを抽出するラベル列を見つけます。
data:image/s3,"s3://crabby-images/3edb4/3edb4f0a6c45c724ce8dd85449869304a811f064" alt=""
xpath位置決めを利用してデータを抽出する必要があるリスト
data:image/s3,"s3://crabby-images/b195b/b195b33c081958a193ee52a6edc957d6cfdd0a46" alt=""
その後、対応するデータを1つずつ抽出します。
data:image/s3,"s3://crabby-images/6c9f8/6c9f87021747d5bd897bcbf7642be542edf77760" alt=""
csvにデータを保存:
data:image/s3,"s3://crabby-images/87ef8/87ef8e3342132428a2b1a5d04d1a627e0e6c3421" alt=""
開発者ツールを使って次のページのボタンのあるラベルを見つけます。
data:image/s3,"s3://crabby-images/86407/864076104c39137cf0c90243c93f1279ba01d971" alt=""
このラベルオブジェクトをxpathで抽出して返します。
data:image/s3,"s3://crabby-images/dfec0/dfec06ea84ba2f4973a6b9192483d20ae4a7bc1a" alt=""
イベントを呼び出し、上記のプロセスを繰り返します。
data:image/s3,"s3://crabby-images/cb935/cb9359e6a151dd03a5cc9eaa34c3df062bac26e1" alt=""
最終効果図:
data:image/s3,"s3://crabby-images/86fe7/86fe7d77b64890192742414fd775f51a313ecbf6" alt=""
コード:
from selenium import webdriver
import time
import re
class Douyu(object):
def __init__(self):
# url
self.start_url = "https://www.douyu.com/directory/all"
# Chrome
self.driver = webdriver.Chrome()
# csv
self.start_csv = True
def __del__(self):
self.driver.quit()
def get_content(self):
# ,
time.sleep(2)
item = {}
#
next_page = self.driver.find_element_by_xpath("//span[text()=' ']/..")
#
is_next_url = next_page.get_attribute("aria-disabled")
# li
li_list = self.driver.find_elements_by_xpath("//ul[@class='layout-Cover-list']//li")
#
for li in li_list:
item["user-id"] = li.find_element_by_xpath(".//div[@class='DyListCover-userName']").text
item["img"] = li.find_element_by_xpath(".//div[@class='DyListCover-imgWrap']//img").get_attribute("src")
item['class-name'] = li.find_element_by_xpath(".//span[@class='DyListCover-zone']").text
item["click-hot"] = li.find_element_by_xpath(".//span[@class='DyListCover-hot']").text
item["click-hot"] = re.sub(r'
','',item['click-hot'])
#
self.save_csv(item)
# ,
return next_page,is_next_url
def save_csv(self,item):
# csv csv
str = ','.join([i for i in item.values()])
with open('./douyu.csv','a',encoding='utf-8') as f:
if self.start_csv:
f.write(" id,image, ,
")
self.start_csv = False
# csv
f.write(str)
f.write('
')
print("save success")
def run(self):
# chrome
self.driver.get(self.start_url)
while True:
# ,
next_page,is_next = self.get_content()
if is_next!='false':
break
#
next_page.click()
if __name__=='__main__':
douyu_spider = Douyu()
douyu_spider.run()
ここで、python爬虫類についてはseleniumを利用して自動的にページをめくってある魚のデータを取る構想について詳しく解説した文章を紹介します。これに関連して、python爬虫類は自動的にページをめくってある魚のデータの内容を取ることができます。私達の以前の文章を検索してください。または引き続き下記の関連文章をご覧ください。これからもよろしくお願いします。