news 2026/9/27 4:25:24

Selenium 3.141.0 + Chrome 109 爬取B站热门视频数据的避坑指南(附完整代码)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Selenium 3.141.0 + Chrome 109 爬取B站热门视频数据的避坑指南(附完整代码)

Selenium 3.141.0与Chrome 109爬取B站数据的实战避坑指南

1. 环境配置的版本陷阱

当使用Selenium进行网页数据采集时,版本兼容性问题往往是第一个拦路虎。以Selenium 3.141.0和Chrome 109这对组合为例,我们需要特别注意以下几个关键点:

1.1 驱动版本精确匹配

ChromeDriver必须与Chrome浏览器版本严格对应。例如Chrome 109.0.5414.120对应的驱动版本是ChromeDriver 109.0.5414.74。版本不匹配会导致如下典型错误:

SessionNotCreatedException: Message: session not created: This version of ChromeDriver only supports Chrome version 114 Current browser version is 109.0.5414.120

解决方案:

  • 通过以下命令查看Chrome精确版本:
google-chrome --version
  • 到ChromeDriver官网下载对应版本
  • 将驱动文件放在系统PATH路径或项目目录下

1.2 浏览器自动更新防御

Chrome默认会自动更新,这会导致驱动突然失效。禁用自动更新的方法如下:

Windows系统:

  1. 进入Chrome安装目录(通常为C:\Program Files\Google\Chrome\Application)
  2. 修改Update文件夹权限为拒绝写入

Mac系统:

# 禁用自动更新服务 sudo launchctl unload -w /Library/LaunchDaemons/com.google.keystone.daemon.plist

2. 实战爬取B站热门数据

2.1 爬取热门视频排行榜

以下是获取B站全站热门TOP100视频数据的完整代码框架:

from selenium import webdriver from selenium.webdriver.common.by import By import pandas as pd import time def get_top100(): driver = webdriver.Chrome() driver.get("https://www.bilibili.com/v/popular/rank/all") results = [] for i in range(1, 101): item = {} # 使用相对XPath提高稳定性 item['title'] = driver.find_element( By.XPATH, f'//li[{i}]//div[@class="info"]/a').text item['up'] = driver.find_element( By.XPATH, f'//li[{i}]//div[@class="detail"]/a/span').text item['view'] = format_num( driver.find_element(By.XPATH, f'//li[{i}]//div[@class="detail"]/span[1]').text) item['danmu'] = format_num( driver.find_element(By.XPATH, f'//li[{i}]//div[@class="detail"]/span[2]').text) results.append(item) pd.DataFrame(results).to_csv('top100.csv', index=False) driver.quit() def format_num(s): """处理'万'单位数据""" if '万' in s: return str(float(s.replace('万',''))*10000) return s

关键技巧:

  • 使用//相对路径替代绝对路径,提高XPath适应性
  • 对含"万"的数据进行标准化处理
  • 每次操作后添加适当延时,避免触发反爬

2.2 处理动态加载内容

B站很多数据是通过AJAX动态加载的,需要特殊处理:

from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC def get_comments(video_url): driver = webdriver.Chrome() driver.get(video_url) # 等待评论区加载 WebDriverWait(driver, 10).until( EC.presence_of_element_located((By.CLASS_NAME, "reply-item")) ) # 滚动加载更多评论 for _ in range(5): driver.execute_script("window.scrollTo(0, document.body.scrollHeight);") time.sleep(2) comments = [e.text for e in driver.find_elements(By.CLASS_NAME, "reply-content")] pd.DataFrame(comments, columns=['comment']).to_csv('comments.csv')

3. 常见问题解决方案

3.1 元素定位失败处理

错误类型解决方案代码示例
NoSuchElementException增加显式等待WebDriverWait(driver,10).until()
StaleElementReference重新定位元素element = driver.find_element()
ElementNotInteractable使用JS点击driver.execute_script("arguments[0].click()", element)

3.2 反爬机制规避策略

  1. 请求频率控制:
import random time.sleep(random.uniform(1, 3))
  1. User-Agent轮换:
from selenium.webdriver.chrome.options import Options options = Options() options.add_argument("user-agent=Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36") driver = webdriver.Chrome(options=options)
  1. 无头模式设置:
options.add_argument("--headless") options.add_argument("--disable-gpu")

4. 数据可视化实战

使用pyecharts创建专业级可视化图表:

4.1 热门视频数据对比

from pyecharts.charts import Bar from pyecharts import options as opts def create_bar_chart(): df = pd.read_csv('top100.csv') bar = ( Bar() .add_xaxis(df['title'].tolist()[:10]) .add_yaxis("播放量", df['view'].astype(float).tolist()[:10]) .add_yaxis("弹幕数", df['danmu'].astype(float).tolist()[:10]) .set_global_opts( title_opts=opts.TitleOpts(title="B站热门视频TOP10"), datazoom_opts=[opts.DataZoomOpts()] ) ) bar.render("top10_bar.html")

4.2 评论情感分析饼图

from pyecharts.charts import Pie def create_pie_chart(): sentiment = {'正面': 65, '中性': 20, '负面': 15} pie = ( Pie() .add("", list(sentiment.items())) .set_series_opts(label_opts=opts.LabelOpts(formatter="{b}: {c} ({d}%)")) ) pie.render("sentiment_pie.html")

5. 高级技巧与优化

5.1 使用Page Object模式

创建bilibili_page.py提高代码可维护性:

class BilibiliRankPage: def __init__(self, driver): self.driver = driver self.url = "https://www.bilibili.com/v/popular/rank/all" def open(self): self.driver.get(self.url) return self def get_video_info(self, index): return { 'title': self._get_text(f'//li[{index}]//div[@class="info"]/a'), 'up': self._get_text(f'//li[{index}]//div[@class="detail"]/a/span') } def _get_text(self, xpath): return self.driver.find_element(By.XPATH, xpath).text

5.2 使用代理IP池

PROXY = "12.34.56.78:8080" options = Options() options.add_argument(f'--proxy-server=http://{PROXY}') driver = webdriver.Chrome(options=options)

5.3 异常自动重试机制

from retrying import retry @retry(stop_max_attempt_number=3, wait_fixed=2000) def safe_click(element): try: element.click() except Exception as e: print(f"点击失败: {str(e)}") raise e

在实际项目中,建议将配置信息如驱动路径、代理IP等提取到单独的配置文件中,方便维护和修改。对于大规模采集任务,可以考虑结合Scrapy等框架构建更健壮的爬虫系统。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/23 9:42:00

展讯ylog抓取全攻略:从工程模式到日志分析(附Python环境配置)

展讯ylog抓取与深度解析:从硬件差异到自动化分析实战 在移动设备开发与调试领域,日志抓取是定位问题的黄金钥匙。展讯平台作为国产芯片的重要代表,其ylog系统提供了从底层硬件到上层应用的完整日志捕获能力。不同于简单的操作指南&#xff0c…

作者头像 李华
网站建设 2026/8/23 9:42:00

万字干货!ChatGPT+Python重构爬虫:非结构化网页解析效率提升10倍

做爬虫的人最头疼的事情是什么?肯定是网页改版!我之前做过一个新闻网站的采集项目,要爬30多个不同的新闻网站,每个网站的结构都不一样,光写XPath规则就花了我一周的时间,结果刚上线半个月,就有5…

作者头像 李华
网站建设 2026/8/23 9:42:01

解决LCD屏幕偏色问题:OTP烧录的常见误区与优化方案

LCD屏幕色彩校准:OTP烧录技术深度解析与实战指南 当你在展厅里看到一排同型号的LCD显示器,却发现每台屏幕的色温、亮度存在肉眼可见的差异时,这背后往往与OTP烧录工艺的精细程度直接相关。作为显示行业确保产品一致性的关键技术,O…

作者头像 李华