공공데이터 AI Ready를 위한
우리데이터클리닉 V1.0
공공데이터를 별도의 복잡한 전처리 없이 AI 모델 학습 및 RAG(검색 증강 생성)에 즉시 활용할 수 있도록 지원하는 AI-Ready 데이터 구축 솔루션입니다. GS(Good Software) 1등급 인증을 획득하였으며, 원천 데이터베이스의 품질 저하 및 비표준화 문제를 해결하여 AI 환각 현상, 학습 편향, 데이터 통합 불가 등의 결함을 사전에 예방합니다.
우리데이터클리닉은 원천 데이터베이스의 품질 저하와 비표준화 문제를 해결하여
공공데이터를 AI가 즉시 활용할 수 있는 상태로 만들어 드립니다.
우리데이터클리닉 V1.0은 공공데이터를 별도의 복잡한 전처리 없이 AI 모델 학습 및 RAG(검색 증강 생성)에 즉시 활용할 수 있도록 지원하는 'AI-Ready 데이터 구축 솔루션'입니다. GS(Good Software) 1등급 인증을 획득하였으며, 원천 데이터베이스(DB)의 품질 저하 및 비표준화 문제를 해결하여 AI 환각 현상(Hallucination), 학습 편향, 데이터 통합 불가 등의 결함을 사전에 예방합니다.
특장점
역공학 기반 메타데이터 자동 관리
운영 중인 다양한 DBMS(외산 9종, 국산 4종)와 실시간 연결하여 메타데이터를 추출 및 관리하며, DB와 산출물 간 실시간 현행화율 100%를 보장합니다.
One-Stop 데이터 클리닉 (진단·처방·치료)
데이터 구조, 표준, 값의 결함을 진단하고, 지능형 처방 및 UI 화면으로 데이터를 직접 확인하면서 치료(수정)하는 기능을 제공하여 DB 표준을 자동으로 준수합니다.
표준 및 검증 규칙 자동 생성
형태소 분석 기반으로 기관/DB 표준(단어·용어·도메인·코드)을 자동 도출하고 생성하며, 수작업 없이 데이터 값 검증 규칙을 지능적으로 자동 추천합니다.
통합 품질 수준 실시간 모니터링
데이터 구조, 표준, 값의 품질 수준을 실시간으로 통합 모니터링하고 개선합니다.
행정안전부 평가 대비 산출물 16종 자동화
공공데이터 품질수준 평가 및 품질인증 심사에 필수적인 16종의 공공표준 산출물과 등록 양식을 자동 생성합니다.
광범위한 DBMS 호환성
Oracle, MySQL, PostgreSQL, MSSQL 등 외산 9종 및 Altibase, Tibero, CUBRID 등 국산 4종 DBMS의 실시간 역공학을 완벽하게 지원합니다.
AI 지식베이스(Vector DB) 연동 최적화
원천 DB의 정제된 데이터를 기반으로 텍스트 임베딩(Embedding) 및 RAG 파이프라인 구축에 최적화된 데이터 구조를 제공합니다.
주요기능
메타데이터 수집 및 산출물
- 역공학 기반 물리 DB 분석 및 메타데이터 자동 추출
- 엔티티/테이블/애트리뷰트/칼럼/관계 정의서 등 산출물 6종 자동 생성
- 범정부 중앙메타 수동/일괄 등록 양식 자동 생성
데이터 구조 클리닉
- 한글/영문 칼럼명 및 데이터 타입 불일치 진단/수정
- 기본키(PK) 미존재, 외래키(FK) 참조 인덱스 및 참조키 미존재 진단
- 영문 칼럼명 기준 Null 허용 여부 불일치 진단
데이터 표준 클리닉
- 형태소 분석 기반 표준 단어/용어/도메인/코드 자동 추출, 생성 및 추천
- 공공표준 미준수 및 중복 용어 진단/치료
- 기관 공통 표준 자동 승격 및 매핑 관리
데이터 값 클리닉
- 데이터 값 기반 지능형 검증 규칙(도메인, 코드, 업무 규칙) 수작업 없이 자동 추천
- 실시간 오류 데이터 조회 및 화면을 통한 즉시 확인·치료(수정)
- 유효성, 완결성(글자 깨짐, 공백), 정합성 진단
품질 평가 및 모니터링
- 데이터 구조/표준/값 품질 수준의 실시간 통합 모니터링 및 개선
- 공공데이터 품질 수준평가(16종) 제출 양식 및 증빙 산출물 자동 생성
도입 시 기대효과
공공데이터의 "AI-Ready" 즉시 달성 및 구축 비용 절감
데이터 수작업 해석 및 복잡한 전처리 과정을 자동화하여 AI 모델 학습 및 RAG 지식베이스 구축에 소요되는 시간과 비용을 획기적으로 절감합니다.
수작업 행정 부담 절감 및 업무 생산성 극대화
품질 진단, 검증 규칙 생성, 16종의 공공 표준 산출물 완성을 자동화하여 수작업 대비 데이터 진단·정제 작업 시간 및 담당자의 행정 업무 부담을 대폭 감소시킵니다.
공공데이터 품질 평가 및 품질인증 완벽 대비
행정안전부 주관 '공공데이터 품질관리 수준평가'에 상시 대비할 수 있으며, 공공데이터 품질인증(최우수/우수 등급) 획득을 효과적으로 지원합니다.
데이터 신뢰성 향상 및 거버넌스 체계 확립
데이터 품질 결함 및 비표준 요소를 사전에 제거하여 AI 시스템의 환각 현상 및 오류를 예방하고, DB와 문서 간 일치율 100%의 실시간 데이터 거버넌스를 구현합니다.
역공학 메타데이터 관리 및 데이터 품질 클리닉 솔루션 기대 효과
메타데이터 산출물
- 메타데이터 관리 부재
- 산출물 부재 또는 현행화 미흡
데이터 표준화
- 데이터 표준관리 체계
- 데이터 표준화 미시행
- 표준화 관리 도구 부재
데이터 값 오류
- 데이터 품질관리 체계
- 데이터 품질관리 경험 부족
- 데이터 검증룰 설정 어려움
- 지속적으로 오류 데이터 발생
메타데이터 관리 체계 확보
- 메타데이터 관리 시스템에 의한 디지털 산출물 관리
- 상시 물리 DB와 일치한 메타데이터 관리 가능
- 상시 데이터 값 품질 진단/처방/치료 관리 체계 확보
공공데이터 품질 진단 준비 용이
- 메타데이터 관리 시스템에서 산출물 증빙 자동 작성
- 데이터 표준화로 품질진단을 위한 자동 표준 설정
- 수 만개 칼럼에 대한 데이터 값 검증을 자동 설정
진단 결과 개선 대상 제시로 즉시 데이터 클리닉 가능
- 데이터 설계 결함에 대한 개선 방안 제시
- 역공학 활용한 DBMS 자동 리버스로 구조정의 산출물 자동 작성으로 산출물의 디지털 전환
- 모든 오류 데이터 값 자동 추출하여 수정 가능
품질 검증 규칙과 증빙 산출물의 완전 일치로 평가수준 향상
- 표준정의 산출물과 표준진단 결과의 완전 일치로 평가수준 향상
- 구조정의 산출물과 구조진단 결과의 완전 일치로 평가수준 향상
- 데이터 값 검증규칙 자동 생성으로 평가수준 향상 용이
활용분야
AI 학습 데이터셋 및 RAG 연동 DB 구축
기관 원천 DB를 AI 학습용 및 Vector DB 연동용 고품질 데이터로 전환합니다.
공공데이터 품질관리 수준진단·평가 대응
행정안전부 품질수준평가 대비 및 만점 수준의 증빙 관리를 지원합니다.
공공데이터 품질인증 획득
최우수(S) 및 우수(A) 등급 심사 대응을 지원합니다.
차세대 시스템 구축 및 감리 지원
신규 개발 감리 시 구조/표준 점검 및 유지보수 단계의 산출물 현행화를 지원합니다.
레퍼런스
행정안전부 컨설팅 사업 적용
2024년~2026년 행정안전부 "데이터 품질 수준 진단평가" 컨설팅 사업에 솔루션이 활용되었습니다.
주요 적용 기관 사례
서울주택도시개발공사, 한국해양수산연수원, 통영시, 동북아역사재단, 한국원자력환경공단, 청도군, 구로구, 한국환경산업기술원, 거제시 등 다수 기관에 적용되었습니다.