inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

따라하며 익히는 크롤링 마스터 with데이터공방

엑셀 파일에 저장하기

넷플릭스 크롤링 데이터 엑셀파일저장

648

jiwon6760

작성한 질문수 7

0

! pip install selenium

from selenium import webdriver

browser = webdriver.Chrome('c:/인프라수업자료/chromedriver')

url = 'https://www.netflix.com/kr/browse/genre/839338'

browser.get(url)

html = browser.page_source

from bs4 import BeautifulSoup

soup = BeautifulSoup(html,'html.parser')

section_list = soup.select('section')

results = []

for section in section_list:

    section_title = section.select('h2')[0].text

    program_list = section.select('li')

    for program in program_list:

        program_title = program.select('span.nm-collections-title-name')[0].text

        program_img = program.select('img')[0]['src']

        program_link = program.select('a')[0]['href']

        data = [section_title,program_title, program_img, program_link]

        results.append(data)

import pandas as pd

df = pd.DataFrame(results)

df.columns = ['카테고리', '프로그램명', '이미지', '링크']

df.to_excel('c:/인프라수업자료/엑셀파일저장하기.xlsx')

section_title설정해줄 때 [0].text를 해줬는데도 엑셀파일 상에서 카테고리명이 저렇게 나타나요. 그리고 데이터 이미지도 일부분은 주소가 잘 써져있는데 일부분은 저렇게 나타나는데 왜그럴까요..??

웹-크롤링 python

답변 1

0

데이터공방

 

동일한 코드로 테스트를 해봐도 이상이 없는데,, 이상하네요. 

section_title = section.select('h2')[0].text

실제 실행하셨을때에는  위 코드가 아닌

section_title = section.select('h2')

코드로 실행이 되었을 것 같습니다.

(혹은,, 아래 부분에서 한번 더 실행이 되었을 수도 있을 것 같네요)

 

쥬피터노트북으로 실행중이시면 

코드 하나 하나 정리해보면서 실행해보시는 것을 추천드립니다.

 

 

 

넥플릭스 이미지 주소의 경우에는 

넷플릭스 크롤링(1page 크롤링) - 프로그램 정보 수집하기 강의에서 18분 이후부터 설명 드렸던 것 처럼

화면에 보이는 이미지만 가져오기 때문에 그렇습니다. 

강의 내용 한번 더 확인 요청드려요

 

 

0

jiwon6760

감사합니다!!

Basic LLM Chain 에서 Paser 를 사용해 JASON 형식으로 바꾸는 부분에서 에러가 발생합니다

0

3

1

FMP API 유료

0

8

0

강의가 넘 좋아서 3번째 복습을 하고 있는데

0

6

1

예측에 사용하는 경제지표의 활용에 대해

0

6

1

14강 "" 사용 관련 질문

0

9

2

강의 자료를 어디서 확인 할 수 있나요?

1

12

2

FRED API

1

17

1

캐글 제출 점수

0

14

2

VCP 시그널 상태 추가 스크립트 에서 return_pct 조건

0

15

2

캐쉬가 업데이트 안됩니다.

0

13

2

기출 마무리 방법

0

33

2

제가 AWS 에 배포했는데

1

22

1

빅이시 작업형2 기초 - 케이스 1~3 관련 문의

0

22

2

갑자기 stock_prediction은 어디서 발생한건가요?

1

22

2

pipeline/run-buy-pipeline 실행시 "LLM호출전체실패"에러발생

1

18

2

데이터프레임 슬라이싱 인덱싱 질문2

0

22

2

SSL 발급할때 HTTP로 진행하는 이유가 궁금합니다.

0

18

2

단일표본검정, 샤피로검정, 윌콕슨검정

0

28

2

강의자료 다운로드 여부

0

30

2

2-14.\x02 안보임 관련

0

19

1

문제에 첨부된 예시와 실제 출력된 샘플 비교

0

26

2

크롤링 페이지 접속 에러

0

529

1

넷플릭스 크롤링

0

757

2

유튜브 크롤링 방법

0

393

1