如何用 Python 抓取 javascript 网站？

百变鹏仔 5个月前 (01-18) #Python

文章标签如何用

问题内容

我正在尝试抓取一个网站。我尝试过使用两种方法，但两种方法都没有为我提供我正在寻找的完整网站源代码。我正在尝试从下面提供的网站 url 中抓取新闻标题。

网址：“https://www.todayonline.com/”

这是我尝试过但失败的两种方法。

方法一：美汤

tdy_url = "https://www.todayonline.com/"page = requests.get(tdy_url).textsoup = beautifulsoup(page)soup  # returns me a html with javascript textsoup.find_all('h3')### returns me empty list []

方法2：selenium + beautifulsoup

tdy_url = "https://www.todayonline.com/"options = Options()options.headless = Truedriver = webdriver.Chrome("chromedriver",options=options)driver.get(tdy_url)time.sleep(10)html = driver.page_sourcesoup = BeautifulSoup(html)soup.find_all('h3')### Returns me only less than 1/4 of the 'h3' tags found in the original page source

请帮忙。我尝试过抓取其他新闻网站，这要容易得多。谢谢。

立即学习“Java免费学习笔记（深入）”；

正确答案

您可以通过 api 访问数据（查看“网络”选项卡）：

例如，

import requestsurl = "https://www.todayonline.com/api/v3/news_feed/7"data = requests.get(url).json()

文章推荐

如何用 Python 抓取 javascript 网站？

方法一：美汤

方法2：selenium + beautifulsoup

正确答案

Python实现字典的key和values的交换

使用Python脚本来获取Cisco设备信息的示例

Python的Django中django-userena组件的简单使用教程

零基础写python爬虫之神器正则表达式

零基础写python爬虫之抓取百度贴吧代码分享