인프런 영문 브랜드 로고
인프런 영문 브랜드 로고

인프런 커뮤니티 질문&답변

bgw2001님의 프로필 이미지
bgw2001

작성한 질문수

[개정판] 파이썬 머신러닝 완벽 가이드

문서 군집화 소개와 실습에서 질문 있습니다.

해결된 질문

작성

·

207

0

텍스트를 벡터화하는 과정에 남는 "."을 replace로 지우지않고 소스 코드에서는 따로 for문을 만들어 지웠는데 replace로 지웠을 때와 어떤 차이가 있는지 궁금합니다.

답변 4

1

권 철민님의 프로필 이미지
권 철민
지식공유자

replace로 . 를 지운다는 의미를 제가 정확히 이해하질 못했습니다. 다른 코드에서 replace를 .로 지운 경우를 보셨는데, 이 코드는 그게 적용이 되지 않은 이유를 물으신 걸로 간주하고 답변 하겠습니다.

위 코드는 replace로 지우는 코드가 아닙니다.  문장을 token화 하는 기준이 되는 puctuation character(. ,comma, space, 개행문자들을) remove_punct_dict 받아서 이들 문자를 기준으로 문장을 토큰화 하는 것입니다(자동으로 token charactor는 지워지게 됩니다)

ntlk.word_tokenize(text_lower().translate(remove_puct_dict) 를 기반으로 word tokenizer 객체를 만들고 이를 LemTokens()에서 호출하여 문장을 token화하여 이 개별 token화된 word들에 대해서 lemmatization을 적용하여 리스트(list)형태로 반환하는 것입니다.

감사합니다.

1

권 철민님의 프로필 이미지
권 철민
지식공유자

안녕하십니까,

요청하신 부분이 정확히 책의 몇 page인지 제가 찾기 어렵군요.  책 페이지나 아님 소스코드를 부탁드려도 될까요?

0

bgw2001님의 프로필 이미지
bgw2001
질문자

감사합니다 ~!!! 

0

bgw2001님의 프로필 이미지
bgw2001
질문자

이 부분입니다 ㅜㅜ 

bgw2001님의 프로필 이미지
bgw2001

작성한 질문수

질문하기