inflearn logo
강의

Khóa học

Chia sẻ kiến thức

Thu thập dữ liệu cực kỳ đơn giản và tốc độ cao (thu thập dữ liệu Python)

Tìm và thu thập thông tin liên kết URL

질문이요

267

Inhoo Song

5 câu hỏi đã được viết

2

import requests
from bs4 import BeautifulSoup
req = requests.get(
'https://www.donga.com/news/Entertainment/List?p=1&prod=news&ymd=&m=')
soup = BeautifulSoup(req.text
, 'html.parser')

for i in soup.select("#contents > div.page > a") :

req2 = requests.get(
"http://www.donga.com/news/List/Enter/" + i['href'])
soup2 = BeautifulSoup(req2.text
, 'html.parser')

for i in soup2.find_all("span", class_="tit") :
print(i.text)


C:\Users\karma\PycharmProjects\pychamwebcrawling\venv\Scripts\python.exe "C:/Users/karma/PycharmProjects/pychamwebcrawling/01_web_crawling_naver_test/url 링크 찾아내서 크롤링.py" Process finished with exit code 0

머가 문제인건가요???


웹-크롤링 python

Câu trả lời 4

0

bokchi

파이팅입니다~

0

irunspal

감사합니다.

기초가부족한 상태라

기초를 잘 다져서 따라해보겠습니다

0

bokchi

코드를 약간 수정했습니다 여기서부터 한번 시작해보실래요?

0

bokchi

import requests
from bs4 import BeautifulSoup
req = requests.get('https://www.donga.com/news/Entertainment/List?p=1&prod=news&ymd=&m=')
soup = BeautifulSoup(req.text, 'html.parser')

print(soup.select("#content > div.page > a"))

for i in soup.select("#content > div.page > a") :
print("http://www.donga.com/news/List/Enter/" + i['href'])

섹션1.9 질문입니다!

0

6

2

웹서비스 방법

0

8

0

MCP 정의가 잘못되어 있음 (Chapter2)

0

15

1

수강 연장 문의드립니다.

0

11

1

13. (App 2) 기본기 훈련 에서

0

14

1

채점 프로그램 미작동

0

13

2

챌린지 시작일 문의

0

18

0

2. 어떤 도구를 사용하는 것이 가장 유리할까? 강의 중

0

16

1

안녕하세요 ppt 자료 메일로 부탁드립니다

0

12

1

11차시 Antigravity IDE 설치 후

0

19

1

안녕하세요 파이썬 관련 문의드립니다

0

296

1

개발자님 도와주세요

0

233

1

질문입니다

0

275

3

크롬드라이버 설치

0

281

1

크롬드라이버 설치질문

0

219

1

브라우저가 안나와요

0

244

1

에디터와 모듈 관련

0

216

1

여러 페이지 크롤링

0

294

3

패키지 설치 방법 알려주세요

0

463

3

셀레니움 설치 관련

0

267

1

12페이지 이후 print

0

220

3

파이참설치안하고 아나콘다의 주피터 노트북으로 강의내용 따라가도되나요~?

0

253

3

chromedriver 라이브러리

2

339

3

다음 실시간 검색어 클래스 추출 불가

1

290

1