inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

초간단 초스피드 데이터 수집 (파이썬 크롤링)

url 링크 찾아내서 크롤링

12페이지 이후 print

219

j.hyeon0930

작성한 질문수 2

0

따라 해보니까 페이지 11 마지막 기사까지만 print가 되는데요, 12페이지 이후로는 왜 안 되는 건가요? 동아일보 웹페이지는 100페이지 이후로까지 있던데요. 이유가 무엇인가요? 12페이지 이후로도 print 하려면 어떻게 해야 하나요? 

웹-크롤링 python

답변 3

0

개복치개발자

안녕하세요 

왜냐하면 반복문이 soup.select("#contents > div.page >a ") 의 크기만큼 동작하는데

soup.select("#contents > div.page >a ") 이 부분의 크기가 11입니다.

soup.select("#contents > div.page >a ") 이 부분을 range(0,20)이라고 바꾸시면 20페이지까지 동작하실 겁니다 :)

0

j.hyeon0930

먼저 답변 감사드려요. 돌아는 가는데요, 11페이지 마지막 기사까지만 추출이 돼요. 그 이후에도 페이지가 100넘게까지 있는데, 그건 추출이 안 되네요. 아래 코드로 했어요. 

import requests
from bs4 import BeautifulSoup

req = requests.get("http://www.donga.com/news/List/Enter/?p=1&prod=news&ymd=&m=") # 엔터치기
soup = BeautifulSoup(req.text, 'html.parser') ## 이런 식으로 HTMl에 있는 코드를 다 가져온다

for i in soup.select("#contents > div.page >a "):
req2 = requests.get("http://www.donga.com/news/List/Enter/" + i['href']) # 페이지별 돌아다니기
soup2 = BeautifulSoup(req2.text, 'html.parser')

for i in soup2.find_all("span", class_="tit") :
print(i.text) # 기사 제목 가져오기

0

개복치개발자

안녕하세요!

혹시 에러코드가 나오나요 아니면 그냥 돌아가지 않는 것일까요?

해당 코드를 첨부해주시면 제가 도움드리기 더 쉬울 것 같습니다~

git bash .env

0

8

0

예제 001 실행 안됩니다.

0

10

2

ipython 설치가 안되는거 같습니다.

0

9

1

이론 공부법 요약본 버전 업데이트 문의

0

11

1

피드백 내용 문의드립니다.

0

17

0

백준 서비스 종료로 인한 강의 자료 업데이트 요청드립니다.

0

21

1

백준 사이트 준비중이라 문제를 볼 수 가 없어요

0

15

1

작업형 1번문제... 환경관련

0

22

2

09차 네이버 영화 리뷰 수집 실습 관련 질문

0

24

1

12회 기출은 언제 업데이트 될까요??

0

28

2

안녕하세요 파이썬 관련 문의드립니다

0

296

1

개발자님 도와주세요

0

233

1

질문입니다

0

274

3

크롬드라이버 설치

0

280

1

크롬드라이버 설치질문

0

219

1

질문이요

2

267

4

브라우저가 안나와요

0

244

1

에디터와 모듈 관련

0

215

1

여러 페이지 크롤링

0

293

3

패키지 설치 방법 알려주세요

0

462

3

셀레니움 설치 관련

0

267

1

파이참설치안하고 아나콘다의 주피터 노트북으로 강의내용 따라가도되나요~?

0

252

3

chromedriver 라이브러리

2

338

3

다음 실시간 검색어 클래스 추출 불가

1

290

1