作者:chenjiandongx
B 站我想大家都熟悉吧,其實 B 站的爬蟲網上一搜一大堆。不過?紙上得來終覺淺,絕知此事要躬行,我碼故我在。最終爬取到數據總量為?760萬?條。
準備工作
首先打開 B 站,隨便在首頁找一個視頻點擊進去。常規(guī)操作,打開開發(fā)者工具。這次是目標是通過爬取 B 站提供的 api 來獲取視頻信息,不去解析網頁,解析網頁的速度太慢了而且容易被封 ip。
勾選 JS 選項,F5 刷新
找到了 api 的地址
復制下來,去除沒必要的內容,得到?https://api.bilibili.com/x/web-interface/archive/stat?aid=15906633?,用瀏覽器打開,會得到如下的 json 數據
動手寫碼
好了,到這里代碼就可以碼起來了,通過 request 不斷的迭代獲取數據,為了讓爬蟲更高效,可以利用多線程。
核心代碼
result = []req = requests.get(url, headers=headers, timeout=6).json()time.sleep(0.6) # 延遲,避免太快 ip 被封try: data = req['data'] video = Video( data['aid'], # 視頻編號 data['view'], # 播放量 data['danmaku'], # 彈幕數 data['reply'], # 評論數 data['favorite'], # 收藏數 data['coin'], # 硬幣數 data['share'] # 分享數 ) with lock: result.append(video)except: pass
迭代爬取
urls = ["http://api.bilibili.com/archive_stat/stat?aid={}".format(i) for i in range(10000)] with futures.ThreadPoolExecutor(32) as executor: # 多線程 executor.map(run, urls)
不要一次性爬取全部鏈接,我是利用兩個進程,這樣就是多進程+多線程了。一個進程一次大概爬取 50w 條數據。100w 條數據的話大概一個多小時吧。分多次爬取,分別將數據保存為不同的文件名,最后再匯總。
運行的效果大概是這樣的,數字是已經已經爬取了多少條鏈接,其實完全可以在一天或者兩天內就把全站信息爬完的。
至于爬取后要怎么處理就看自己愛好了,我是先保存為 csv 文件,然后再匯總插入到數據庫。
匯總的 csv 文件
數據庫表
由于這些內容是我在幾個月前爬取的,所以數據其實有些滯后了。
數據總量
查詢播放量前十的視頻
查詢回復量前十的視頻
各種花樣查詢任君選擇??!視頻的鏈接為?https://www.bilibili.com/video/av?+ v_aid
- 蜜度索驥:以跨模態(tài)檢索技術助力“企宣”向上生長
- 密態(tài)計算技術助力農村普惠金融 螞蟻密算、網商銀行項目入選大數據“星河”案例
- 專利糾紛升級!Netflix就虛擬機專利侵權起訴博通及VMware
- 兩大難題發(fā)布!華為啟動2024奧林帕斯獎全球征集
- 2025年工業(yè)軟件市場格局:7個關鍵統(tǒng)計數據與分析
- Commvault持續(xù)業(yè)務策略:應對現代數據保護挑戰(zhàn)的新范式
- 2025年網絡安全主要趨勢
- 2025年值得關注的數據中心可持續(xù)發(fā)展趨勢
- 量子計算火熱,投資者又在大舉尋找“量子概念股”
- 從量子威脅到人工智能防御:2025年網絡安全將如何發(fā)展
- 后人工智能時代:2025年,在紛擾中重塑數據、洞察和行動
免責聲明:本網站內容主要來自原創(chuàng)、合作伙伴供稿和第三方自媒體作者投稿,凡在本網站出現的信息,均僅供參考。本網站將盡力確保所提供信息的準確性及可靠性,但不保證有關資料的準確性及可靠性,讀者在使用前請進一步核實,并對任何自主決定的行為負責。本網站對有關資料所引致的錯誤、不確或遺漏,概不負任何法律責任。任何單位或個人認為本網站中的網頁或鏈接內容可能涉嫌侵犯其知識產權或存在不實內容時,應及時向本網站提出書面權利通知或不實情況說明,并提供身份證明、權屬證明及詳細侵權或不實情況證明。本網站在收到上述法律文件后,將會依法盡快聯(lián)系相關文章源頭核實,溝通刪除相關內容或斷開相關鏈接。