자연어 처리: 인공지능의 주요 분야 중 하나

자연어 처리(自然語處理) 또는 자연 언어 처리(自然言語處理)는 인간의 언어 현상을 컴퓨터와 같은 기계를 이용해서 묘사할 수 있도록 연구하고 이를 구현하는 인공지능의 주요 분야 중 하나다. 자연어는 컴퓨터가 이해하기 위해선 프로그래밍 언어로 처리해야 하는데, 컴퓨터가 자연어를 인식 또는 생성할 수 있도록 하는 것이 자연어 처리이다.

자연 언어 처리는 연구 대상이 언어 이기 때문에 당연하게도 언어 자체를 연구하는 언어학과 언어 현상의 내적 기재를 탐구하는 언어 인지 과학과 연관이 깊다.

구현을 위해 수학적 통계적 도구를 많이 활용하며 특히 기계학습 도구를 많이 사용하는 대표적인 분야이다.

정보검색, QA 시스템, 문서 자동 분류, 신문기사 클러스터링, 대화형 에이전트 등 다양한 응용이 이루어지고 있다.

형태소 분석

자연 언어 처리에서 말하는 형태소 분석이란 어떤 대상 어절을 최소의 의미 단위인 '형태소'로 분석하는 것을 의미한다. (형태소는 단어 그 자체가 될 수도 있고, 일반적으로는 단어보다 작은 단위이다.) 정보 검색 엔진에서 한국어의 색인어 추출에 많이 사용한다. 형태소 분석 단계에서 문제가 되는 부분은 미등록어, 오탈자, 띄어쓰기 오류 등에 의한 형태소 분석의 오류, 중의성이나 신조어 처리 등이 있는데, 이들은 형태소 분석에 치명적인 약점이라 할 수 있다. 복합 명사 분해도 형태소 분석의 어려운 문제 중 하나이다. 복합 명사란 하나 이상의 단어가 합쳐서 새로운 의미를 생성해 낸 단어로 '봄바람' 정보검색' '종합정보시스템' 등을 그 예로 들 수 있다. 이러한 단어는 한국어에서 띄어쓰기에 따른 형식도 불분명할 뿐만 아니라 다양한 복합 유형 등에 따라 의미의 통합이나 분해가 다양한 양상을 보이기 때문에 이들 형태소를 분석하는 것은 매우 어려운 문제이다. 기계적으로 복합명사를 처리하는 방식 중의 하나는, 음절 단위를 기반으로 하는 bi-gram이 있다. 예를 들어, '복합 명사'는 음절 단위로 '복합+명사', '복+합명사', '복합명+사'의 세 가지 형태로 쪼갤 수 있고, 이 중 가장 적합한 분해 결과를 문서 내에서 출현하는 빈도 등의 추가 정보를 통해 선택하는 알고리즘이 있을 수 있다. 일반적으로, 다양하게 쪼개지는 분석 결과들 중에서 적합한 결과를 선택하기 위해, 테이블 파싱이라는 동적 프로그래밍 방법을 사용한다.

  • 나는 → 나(대명사) + 는(조사)
  • 나는 → 날(동사) + 는(관형형어미)

품사 부착

형태소 분석을 통해 나온 결과 중 가장 적합한 형태의 품사를 부착하는 것을 말한다. 보통 태거라고 하는 모듈이 이 기능을 수행한다. 이는 형태소 분석기가 출력한 다양한 분석 결과 중에서 문맥에 적합한 하나의 분석 결과를 선택하는 모듈이라 할 수 있다. 분석 시 문맥 좌우에 위치한 중의성 해소의 힌트가 되는 정보를 이용해서 적합한 분석 결과를 선택한다. 보통 태거는 대규모의 품사부착 말뭉치를 이용해서 구현하는데 은닉 마르코프 모델(HMM)이 널리 사용되고 있다.

'나는'이라는 어절에 대한 형태소 분석이 다음과 같다면

  • 나는 → 나(대명사) + 는(조사)
  • 나는 → 날(동사) + 는(관형형어미)

다음과 같이 적절한 품사를 부착하는 것이 품사 부착이다.

  • 나는 오늘 학교에 갔다' → '나(대명사)+는(조사) 오늘 학교+에 가다+았+다'
  • 하늘을 나는 새를 보았다' → '하늘+을 날(동사)+는(관형형어미) 새+를 보다+았+다'

구절 단위 분석

  • 단위 분석은 명사구, 동사구, 부사구 등의 덩어리를 의미한다.
    • 서울시 서초구 서초동에 있는 가장 유명한 회사는 어디인가요? → 서울시 서초구 서초동에 있는 가장 유명한 회사는 어디인가요?
    • 이 해결책은 정말이지 여기에는 적합하지 않아 → 이 해결책정말이지 여기에는 적합하지 않아
  • 단위 분석은 중문, 복문 등의 문장을 단문 단위로 분해하는 역할을 수행한다.
    • 이 영화는 재미있었는데, 저 영화는 흥미 없었다 → 이 영화는 재미있었는데 , 저 영화는 흥미 없었다
    • 어제 내가 본 그 영화는 아주 재미있었다 → 어제 내가 본 그 영화는 아주 재미있었다.
    • 나는 오늘 하늘을 나는 새를 보았다 → 나는 오늘 하늘을 나는 새를 보았다

이와 같이, 구 단위 분석을 먼저 수행하고 절 단위 분석을 해서 보다 큰 단위로 만든다. 이러한 분석은 다음 단계인 구문 분석에서의 중의성을 해소하는 데 아주 중요한 역할을 수행한다고 할 수 있다.

구문 분석

각주

참고 문헌

외부 링크

  • 자연어 처리: 형태소 분석, 품사 부착, 구절 단위 분석  위키미디어 공용에 자연어 처리 관련 미디어 분류가 있습니다.

Tags:

자연어 처리 형태소 분석자연어 처리 품사 부착자연어 처리 구절 단위 분석자연어 처리 구문 분석자연어 처리 각주자연어 처리 참고 문헌자연어 처리 외부 링크자연어 처리

🔥 Trending searches on Wiki 한국어:

호랑이6.25 전쟁김어준황준욱도파민김병만삼성전자독도아카라이브선재 업고 튀어조선밀양 박씨한준호 (정치인)박쥐유신진화론빅 데이터아우구스투스계은숙대한민국 제20대 국회의원 선거전현희김용 (1959년)수지맞은 우리경복궁엄창록정상위매슬로의 욕구단계설제주항공신사임당구글의 이스터 에그 목록대한민국 국민의 무비자입국 가능국가김복준인상주의구글구글 클래스룸방탄소년단볼프강 아마데우스 모차르트이탄희유관순제5군단 (대한민국)숭례문대한민국 제22대 국회의원 선거 서울특별시손웅정수소네이버백제조항리 (아나운서)김혜수기후변화AFC 챔피언스리그이승엽윤명선 (작곡가)도 (각도)반올림김두한이효리대한민국 제21대 국회의원 목록 (정당별)대한민국 제22대 국회의원 선거오스트레일리아이상원 (배우)별이 빛나는 밤트위터오승훈 (아나운서)카자흐스탄증강 현실볼츠만 상수그랑드자트섬의 일요일 오후MBC (동음이의)나비 효과어글리후드강미정아프리카TV삼체 (소설)조국혁신당AFC U-23 아시안컵비삽입성교서윤아채상병콜로세움삼성 라이온즈🡆 More