转载—Python抓取豆瓣电影

发布时间：2019-08-25 09:37:41编辑：auto阅读（1887）

#!/usr/bin/python
# -*-coding:utf-8-*-
# Python:   2.7
# Program:  爬取豆瓣电影
 
from bs4 import BeautifulSoup
import urllib2, json, random, sys
 
reload(sys)
sys.setdefaultencoding('utf-8')
 
def get_data(url):
    my_headers = [
        'Mozilla/5.0 (Windows NT 5.2) AppleWebKit/534.30 (KHTML, like Gecko) Chrome/12.0.742.122 Safari/534.30',
        'Mozilla/5.0 (Windows NT 5.1; rv:5.0) Gecko/20100101 Firefox/5.0',
        'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 5.2; Trident/4.0; .NET CLR 1.1.4322; .NET CLR 2.0.50727; .NET4.0E; .NET CLR 3.0.4506.2152; .NET CLR 3.5.30729; .NET4.0C)',
        'Opera/9.80 (Windows NT 5.1; U; zh-cn) Presto/2.9.168 Version/11.50',
        'Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN) AppleWebKit/533.21.1 (KHTML, like Gecko) Version/5.0.5 Safari/533.21.1',
        'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 5.1; Trident/4.0; .NET CLR 2.0.50727; .NET CLR 3.0.04506.648; .NET CLR 3.5.21022; .NET4.0E; .NET CLR 3.0.4506.2152; .NET CLR 3.5.30729; .NET4.0C)']
    header = {"User-Agent": random.choice(my_headers)}
    req = urllib2.Request(url, headers=header)
    html = urllib2.urlopen(req).read()
    data = json.loads(html)['data']
    return data
 
def get_movieInfo(url):
    my_headers = [
        'Mozilla/5.0 (Windows NT 5.2) AppleWebKit/534.30 (KHTML, like Gecko) Chrome/12.0.742.122 Safari/534.30',
        'Mozilla/5.0 (Windows NT 5.1; rv:5.0) Gecko/20100101 Firefox/5.0',
        'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 5.2; Trident/4.0; .NET CLR 1.1.4322; .NET CLR 2.0.50727; .NET4.0E; .NET CLR 3.0.4506.2152; .NET CLR 3.5.30729; .NET4.0C)',
        'Opera/9.80 (Windows NT 5.1; U; zh-cn) Presto/2.9.168 Version/11.50',
        'Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN) AppleWebKit/533.21.1 (KHTML, like Gecko) Version/5.0.5 Safari/533.21.1',
        'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 5.1; Trident/4.0; .NET CLR 2.0.50727; .NET CLR 3.0.04506.648; .NET CLR 3.5.21022; .NET4.0E; .NET CLR 3.0.4506.2152; .NET CLR 3.5.30729; .NET4.0C)']
    header = {"User-Agent": random.choice(my_headers)}
    req = urllib2.Request(url, headers=header)
    html = urllib2.urlopen(req).read()
    soup = BeautifulSoup(html, 'html.parser')
    movie = {}
    movie['Name'] = soup.find('span',property="v:itemreviewed").text
    movie['Year'] = soup.find('span',class_='year').text
    movie['Rate'] = soup.find('strong', property="v:average").text
    movie['Runtime'] = soup.find('span', property="v:runtime").text
    movie['Summary'] = soup.find('span', property='v:summary').text
    movie['URL'] = url
 
    movie['Directors'] = ''
    directors = soup.find_all('a', rel="v:directedBy")
    for director in directors:
        movie['Directors'] += director.text
        movie['Directors'] += '  '
 
    movie['Stars'] = ''
    stars = soup.find_all('a', rel="v:starring")
    for star in stars:
        movie['Stars'] += star.text
        movie['Stars'] += '  '
 
    movie['Category'] = ''
    categorys = soup.find_all('span', property="v:genre")
    for category in categorys:
        movie['Category'] += category.text
        movie['Category'] += '  '
 
    return movie
 
def get_urls():
    base_url = 'https://movie.douban.com/j/new_search_subjects?sort=R&range=1,10&tags=%E7%94%B5%E5%BD%B1&start='
    urls=[]
    nu = 0
    while True:
        print nu
        url = base_url + str(nu)
        data = get_data(url)
        if len(data) == 0:
            break
        for i in data:
            urls.append(i['url'])
        nu += 20
    return urls
 
if __name__ == '__main__':
    urls = get_urls()
    f = open('movieinfo.txt','w+')
    for url in urls:
        try:
            movie = get_movieInfo(url)
            movie_str = json.dumps(movie,ensure_ascii=False, encoding='UTF-8')
            f.write(movie_str)
            f.write('\n')
            f.flush()
        except:
            print url
            continue
    f.close()

摘自： https://blog.51cto.com/wucl202000/1961206，感谢原作者，供学习参考


                        
                        
                            
关键字：
                                                                
                                
                                
                            
                        

                
                            上一篇：
                                                                    python打印出不同颜色的文字                            
                            下一篇：
                                                                    Python 数据库的Connectio



        


    
    

    
    
    


    
    
        
             
            
                
                    
                        Run博客上线，欢迎访问
                        内容如有侵犯，请立即联系管理员删除
                        本站内容仅供学习和参阅，不做任何商业用途
                    
                
            
        
    

    
    
        
            标签云
        
        
            
                python3djangopython3爬虫python运维开发linuxpyspiderpython基础dockergitsvnpython练习requestsscrapy系统/运维python全栈人工智能bs4tkinterseleniumurllibphppythonrequests_htmlvue图像处理                
                
                
                
                
                
                
                
            
        
    

    



    
    
        
            搜索
        
        
            
                
                    
                        
                        
                    
                
            
        
    

    
    
        
            热门推荐
        
        
            
                 openvpn linux客户端使用
                                         51596 
                    

                    
                        
                            
                            
                        

                     H3C基本命令大全                     51185 
                    

                    
                        
                            
                            
                        

                     openvpn windows客户端使用
                                         41689 
                    

                    
                        
                            
                            
                        

                     H3C IRF原理及 配置                      38450 
                    

                    
                        
                            
                            
                        

                     Python exit()函数
                                         32935 
                    

                    
                        
                            
                            
                        

                     openvpn mac客户端使用                     29922 
                    

                    
                        
                            
                            
                        

                     python全系列官方中文文档
                                         28627 
                    

                    
                        
                            
                            
                        

                     python 获取网卡实时流量                     23592 
                    

                    
                        
                            
                            
                        

                     1.常用turtle功能函数
                                         23523 
                    

                    
                        
                            
                            
                        

                     python 获取Linux和Windows硬件信息                     21870 
                    

                    
                        
                            
                            
                        

                    

            
        
    

    
    
        
            最新文章
        
        
            
                 Python搭建一个RAG系统(分片/检索/召回/重排序/生成)
                                         2027° 
                    
                    
                        
                        
                     Browser-use:智能浏览器自动化(Web-Agent)                     2741° 
                    
                    
                        
                        
                     使用 LangChain 实现本地 Agent
                                         2287° 
                    
                    
                        
                        
                     使用 LangChain 构建本地 RAG 应用                     2215° 
                    
                    
                        
                        
                     使用LLaMA-Factory微调大模型的function calling能力
                                         2693° 
                    
                    
                        
                        
                     复现一个简单Agent系统                     2242° 
                    
                    
                        
                        
                     LLaMA Factory-Lora微调实现声控语音多轮问答对话-1
                                         2989° 
                    
                    
                        
                        
                     LLaMA Factory微调后的模型合并导出和部署-4                     4931° 
                    
                    
                        
                        
                     LLaMA Factory微调模型的各种参数怎么设置-3
                                         4786° 
                    
                    
                        
                        
                     LLaMA Factory构建高质量数据集-2                     3405° 
                    
                    
                        
                        
                                
        
    

    
    
        
            博主信息
        
        
            
                姓名：Run
                职业：谜
                邮箱：383697894@qq.com
                定位：上海 · 松江
            
        
    
    
    
        
            扫我打开
        
        
	    
        
    

    
    
        
            友情链接
        
        
            百度
            淘宝
            腾讯
            慕课网
            CSDN
            博客园
            51cto博客