임베딩이란
벡터 임베딩은 텍스트, 이미지, 오디오 같은 데이터를 고정된 길이의 숫자 배열(벡터)로 변환한 것입니다. 이 변환 과정에서 원본 데이터의 의미적 특징이 벡터 공간상의 위치로 보존됩니다.
왜 벡터로 바꾸는가
컴퓨터는 "고양이"와 "강아지"가 의미적으로 가깝다는 걸 문자 그대로는 알 수 없습니다. 하지만 이 둘을 벡터로 변환하면, 의미가 비슷한 단어일수록 벡터 공간에서 서로 가까운 위치에 놓이게 만들 수 있습니다.
생성 방법(예시)
- Word2Vec 계열: 단어 단위 임베딩의 초기 대표 모델
- BERT 계열: 문맥을 반영한 문장 단위 임베딩
- CNN 기반: 이미지 데이터를 벡터로 변환할 때 흔히 사용
실제 활용 사례
추천 시스템(비슷한 상품 찾기), 시맨틱 검색(키워드가 달라도 의미가 맞으면 검색되게 하기), 문서 분류, 이상 탐지 등 다양한 머신러닝 응용에 기초가 됩니다.
RAG와의 관계
검색증강생성(RAG) 시스템에서도 질문과 문서를 임베딩으로 변환한 뒤, 벡터 공간에서 가장 가까운 문서를 찾아 LLM에 참고자료로 넘겨주는 방식으로 임베딩이 핵심 역할을 합니다.