前言

喜马拉雅是专业的音频分享平台,汇集了有声小说,有声读物,有声书,fm电台,儿童睡前故事,相声小品,鬼故事等数亿条音频,我最喜欢听民间故事和德云社相声集,你呢?

今天带大家爬取喜马拉雅音频数据,一起期待吧!!

这个案例的视频地址在这里

https://v.douyu.com/show/a2jemjj3e3mmnxml

项目目标

爬取喜马拉雅音频数据

受害者地址

本文知识点:

1、系统分析网页性质

2、多层数据解析

3、海量音频数据保存

环境:

1.确定数据所在的链接地址(url)
2.通过代码发送url地址的请求
3.解析数据(要的, 筛选不要的)
4.数据持久化(保存)

案例思路:

1. 在静态数据中获取音频的id值

2. 发送指定id值json数据请求(src)

3. 从json数据中解析音频所对应的url地址 开始写代码

先导入所需的模块

1.确定数据所在的链接地址(url) 逆向分析 网页性质(静态网页/动态网页)

打开开发者工具,播放一个音频,在madie里面可以找到一个数据包

复制url,搜索

找到id值

继续搜索,找到请求头参数

2.通过代码发送url地址的请求

3.解析数据(要的, 筛选不要的) 解析音频的 id值

4.数据持久化(保存)

最后还要处理文件名非法字符

完整代码

运行代码,效果如下图

到此这篇关于python爬虫实战案例之取喜马拉雅音频数据详解的文章就介绍到这了,更多相关python爬取喜马拉雅音频数据内容请搜索www.887551.com以前的文章或继续浏览下面的相关文章希望大家以后多多支持www.887551.com!