네이버 뉴스 크롤링
970
3 asked
안녕하세요,
크롤링을 계속 진행하다 보면 403 에러가 발생합니다. 이를 우회할 방법이 있을까요? chatgpt에 문의를 해봤지만 해결되지 않네요.
Answer 2
0
안녕하세요~. 반갑습니다.
짧은 시간에 너무 많은 크롤링 요청을 진행할 경우 봇으로 인한 접근으로 간주되서 연결을 거부하는 403 에러가 뜰 수 있습니다. 따라서 크롤링 진행시에 단기간에 너무 많은 요청을 하는것은 피하는 것이 좋습니다.
또한 봇으로 인한 접근금지를 우회하는 방법으로 headers 부분에 User-Agent 설정을 시도해 볼 수 있습니다.
[ChatGPT를 이용한 크롤링 업무 자동화 실습 4 - 네이버 증권 종목토론실 크롤링] 영상을 참조해서 requests.get 요청을 할때 아래와 같이 headers 값을 추가해서 진행해보시겠어요?
headers = {'User-Agent' : 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_3)'}
좋은 하루 되세요~.
감사합니다.
0
안녕하세요, 인프런 AI 인턴입니다.
네이버 뉴스 크롤링 시 403 에러는 서버에 의해 접근이 거부되었다는 것을 의미합니다. 이 문제를 해결하기 위해 몇 가지 방법을 시도해 볼 수 있습니다.
- User-Agent 변경: 웹 서버가 크롤러로부터의 요청이 아니라 일반 사용자의 브라우저로부터의 요청으로 인식하도록 User-Agent를 변경해 보세요.
- 프록시 사용: IP 주소가 차단되었을 수 있으므로 프록시 서버를 사용하여 다른 IP 주소를 통해 접근해 보세요.
- 요청 간격 조절: 너무 많은 요청이 짧은 시간 안에 이뤄지면 웹 서버에서 이를 스팸으로 간주할 수 있습니다. 요청 간에 일정 시간 간격을 두어 보세요.
단, 웹 크롤링을 할 때는 해당 웹사이트의 이용 약관을 확인하고 법적인 제한을 준수하며 진행해야 합니다.
saparkkpci님, 원하는 해결책을 찾으시길 바랍니다.
[13번 강의] ChatInterface에 PDF 렌더링이 안되는 이슈 공유
-1
7
1
강의 잘 들었습니다만 부탁이 하나 있어서요..
0
12
2
롱폼 영상 강의도 있으신가요? 도움이 많이 되었습니다.
1
10
1
무서워요 다음에는... 조심.
1
16
1
세셕2부터 영상이 없나요?
1
58
2
안녕하세요
0
27
1
매니패스트 JSON 전문
0
46
5
실습용 자료 링크 어디서 보나요
0
37
1
7강 보고 있는데요.. 글자가 너무 작아요
0
36
1
소스 코드 좀 올려주세요.
0
49
2
파인튜닝 데이터가 이미 학습된 데이터인 경우 어떻게 되나요?
0
58
1
다른 LLM에서의 에이전트 라이브러리 지원여부
0
54
1
44차시 skill 에서
0
55
1
녹화영상 시청
0
39
1
Spring AI 프레임워크를 사용하지 않은 이유
0
61
1
38차시 캔버스와 앱, 그리고 에이전트 모드에서
0
66
2
codex.md
0
52
1
다음 강의 수강방법
0
49
3
Request for Prompts
0
43
1
install까지 설치 하였는데 start 가안됩니다.
1
67
2
챌린지, 강의 차이 문의 드립니다.
0
68
2
수강기간즘연장해주세요
0
43
2
강의 자료 다운로드 관련 문의
0
68
1
파이썬 라이브러리 관련 질문입니다.
0
167
2

