해결된 질문
작성
·
207
0
텍스트를 벡터화하는 과정에 남는 "."을 replace로 지우지않고 소스 코드에서는 따로 for문을 만들어 지웠는데 replace로 지웠을 때와 어떤 차이가 있는지 궁금합니다.
답변 4
1
replace로 . 를 지운다는 의미를 제가 정확히 이해하질 못했습니다. 다른 코드에서 replace를 .로 지운 경우를 보셨는데, 이 코드는 그게 적용이 되지 않은 이유를 물으신 걸로 간주하고 답변 하겠습니다.
위 코드는 replace로 지우는 코드가 아닙니다. 문장을 token화 하는 기준이 되는 puctuation character(. ,comma, space, 개행문자들을) remove_punct_dict 받아서 이들 문자를 기준으로 문장을 토큰화 하는 것입니다(자동으로 token charactor는 지워지게 됩니다)
ntlk.word_tokenize(text_lower().translate(remove_puct_dict) 를 기반으로 word tokenizer 객체를 만들고 이를 LemTokens()에서 호출하여 문장을 token화하여 이 개별 token화된 word들에 대해서 lemmatization을 적용하여 리스트(list)형태로 반환하는 것입니다.
감사합니다.
1
0
0