공공데이터를 AI가 바로 활용할 수 있는 형태로 전환하기 위한 표준과 구현 도구 모음입니다.
AI 모델의 성능은 데이터 품질에 직접적으로 의존합니다. 그러나 공공데이터는 대부분 사람이 읽는 것을 전제로 설계되어 있어, AI가 바로 활용하기 어려운 경우가 많습니다. 메타데이터가 불완전하거나 비표준 형식으로 제공되고, 데이터 구조와 품질 수준이 명시되지 않아 AI 파이프라인에 투입하기 전에 상당한 전처리가 필요합니다.
이 문제는 단순히 데이터를 더 잘 정리하는 것으로는 해결되지 않습니다. AI가 데이터를 활용하는 방식 자체를 고려한 표준이 필요합니다. 어떤 품질 수준인지, 어떤 목적에 적합한지, 어떻게 로딩하고 파싱하는지를 기계가 읽을 수 있는 형태로 데이터와 함께 제공해야 합니다.
이 프로젝트는 그 표준을 제정하고, 구현체를 오픈소스로 함께 제공합니다.
품질개선 항목선정 Quality-Ready Purpose-Ready (활용 예시)
┌─────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ 메타데이터 강화 │ │ 고품질 데이터 생성 │ │ ML/DL 질의응답 │
│ 데이터값 구조 정합성 │ → │ 품질지표 메타데이터 │ → │ 지식그래프 LLM │
│ 참조/코드체계 정비 │ │ 활용 목적별 변환 │ │ 검색·추천 에이전트 │
└─────────────────┘ └──────────────────┘ └──────────────────┘
한국정보통신기술협회(TTA)에서 2026년 제정을 목표로 3개의 AI-Ready Data 표준을 개발 중입니다.
| 표준 | 상태 | 명칭 | 내용 |
|---|---|---|---|
| Part 1 | 제안 완료 | AI-Ready 데이터 품질 진단 프레임워크 | 완전성·일관성·정확성·적시성·유효성·유일성 6개 품질 차원을 정량 공식으로 전환하여, 비교 가능한 단일 척도(QI)와 자동화 가능한 등급 판정 체계(Q-Tier) 정의 |
| Part 2 | 제안 완료 | AI-Ready 데이터 메타데이터 프로파일 | 메타데이터를 3계층(Discovery · Understanding · Operability)으로 구조화하고, ML · RAG · KG · Stats 목적별 프로파일 스키마를 국제 표준 어휘(DCAT · DQV · Croissant · VoID) 기반으로 정의 |
| Part 3 | 제안 완료 | AI-Ready 데이터 변환 및 거버넌스 규격 | Raw → Quality-Ready → Purpose-Ready 3단계 파이프라인의 실행 절차, 품질 게이트 판정 기준, 데이터 계보 기록 방식(PROV-O), 확장 프로파일 등록 거버넌스 정의 |
표준 초안은 확정되는 대로 이 리포지토리에 공개하고 커뮤니티 의견을 수렴할 예정입니다.
표준의 레퍼런스 구현체입니다. 표준 확정 전이라도 활용 가능한 도구를 먼저 제공하며, 표준이 완성되면 업데이트합니다.
| 도구 | 관련 표준 | 설명 | 상태 |
|---|---|---|---|
| catalog-converter | Part 2 | 공공데이터포털 목록개방현황 CSV → DCAT 기반 RDF(JSON-LD, Turtle, N-Triples) 변환 | v0.1 |
| quality-evaluator | Part 1 | 품질 차원별 정량 진단 및 QI · Q-Tier 산출 | 계획 |
| metadata-validator | Part 2 | SHACL 기반 메타데이터 프로파일 검증 | 계획 |
| transform-pipeline | Part 3 | Raw → Quality-Ready → Purpose-Ready 변환 파이프라인 (ML · RAG · KG · Stats 목적별) | 계획 |
aird-tools/
├── shared/ # 공통 네임스페이스, 어휘 정의
├── tools/
│ └── catalog-converter/ # 카탈로그 변환기 (현재 배포 중)
│ ├── src/ # 변환 코드
│ ├── data/ # 원본 데이터
│ ├── docs/ # 매핑 명세, 정제 계획
│ └── examples/ # 샘플 출력
└── (표준 확정에 따라 도구 추가 예정)
| Prefix | URI | 용도 |
|---|---|---|
aird |
http://datahub.kr/ns/aird# |
AI-Ready Data 커스텀 어휘 |
dcat |
http://www.w3.org/ns/dcat# |
데이터 카탈로그 |
dct |
http://purl.org/dc/terms/ |
메타데이터 속성 |
전체 어휘 목록은 shared/namespaces.py 참조.
이 프로젝트에서 사용하는 데이터는 공공데이터포털에서 제공하는 공개 데이터입니다.
- 데이터명: 공공데이터활용지원센터_공공데이터포털 목록개방현황
- 출처: https://www.data.go.kr/data/15062804/fileData.do
- 이용조건: 공공누리(KOGL)
원본 CSV 파일(126MB)은 저장소에 포함되어 있지 않습니다. 위 링크에서 직접 다운로드하여 tools/catalog-converter/data/ 디렉터리에 배치하세요.
표준 개발과 구현 모두에 대한 의견을 환영합니다.
현재는 먼저 배포된 catalog-converter와 관련된 이슈(매핑 오류, 누락 필드, 개선 제안)를 우선 수렴하고 있습니다. 표준 초안이 공개되면 각 파트별 GitHub Discussions를 통해 상세 의견을 수렴할 예정입니다.