[뉴스] 국립중앙도서관, 국가문헌 AI 학습데이터 대국민 첫 공개

국립중앙도서관(관장 남영준)은 9월 17일, 국가문헌에서 구축한 인공지능(AI) 학습데이터를 처음으로 대국민 공개한다. 공개 대상은 텍스트 데이터(Hidden Text PDF, XML, TXT, JSON) 3,974책(건), 표·삽화·광고·사진 등의 이미지 데이터 21,485건, 메타데이터, 문자 단위의 글자 데이터셋 3,830만건 등 총 3,833만 건에 달한다.

이번 데이터 개방과 함께 기존 프로젝트 플랫폼이었던 ‘공유서재(nl.go.kr/aiocr)’를 AI 학습데이터 활용에 최적화된 플랫폼으로 새 단장했다. 이번 개편은 AI 학습, 학술연구, 서비스·앱 개발, 콘텐츠 제작 등 다양한 목적으로 누구나 쉽게 이용할 수 있도록 편의성을 강화하는 데 초점을 두었다.

국가문헌의 재탄생, 인공지능(AI) 학습데이터 3,833만 건 개방

개방 데이터는 국립중앙도서관 소장 디지털화 원문 중 저작권이 해결된 1930~40년대 근대잡지, 1940~60년대 정부간행물 및 교과서, 국립중앙도서관 발간자료와 인공지능(AI) 학습 이용 허락을 받은 오픈 액세스(Open Access, OA) 학술논문 등이다. 누구나 ‘공유서재’에서 자유롭게 열람하고 다운로드해 활용할 수 있다.

텍스트 데이터는 인공지능(AI)이 인식하기 쉽게 정제한 고품질 형태로 제공되어 연구와 서비스 개발에 곧바로 활용할 수 있다. 글자 데이터셋의 경우 다양한 형태의 문자 데이터를 인공지능(AI) 학습에 바로 활용할 수 있어, 대규모 데이터 확보에 어려움을 겪는 중소·벤처기업도 인공지능(AI) 기반 문자인식(OCR)·자연어 처리 등 관련 기술 개발에 폭넓게 이용할 수 있을 것으로 기대된다.

인공지능(AI)·디지털 인문학 연구 기반 플랫폼으로 기능 확대

새 단장한 ‘공유서재’는 인공지능(AI)과 디지털 인문학 연구 지원, 공공데이터 활용 확장을 위한 기능도 함께 강화하였다. 디지털로 축적된 방대한 지식자료를 인공지능(AI)이 학습할 수 있는 형태로 정리·가공함으로써, 기존에는 어려웠던 대규모 데이터 기반 인문학 연구도 가능해진다. 연구자들은 문헌·기록·이미지 등 다양한 자료를 인공지능(AI)으로 분석하고 새로운 의미를 도출하는 디지털 인문학 연구를 보다 쉽게 수행할 수 있을 것으로 기대된다.

누구나 자유롭게, 사용자 중심의 접근성 강화

플랫폼의 사용자 환경(UI/UX)도 이용자 친화적으로 개선되었다. 직관적인 화면 구성과 자료 유형 및 이미지 유형별 탐색 구조를 적용하였으며, 별도의 가입 절차 없이 누구나 쉽게 데이터에 접근할 수 있어 전문 연구자뿐만 아니라 일반 이용자도 손쉽게 자료를 검색하고 활용할 수 있다.

국립중앙도서관은 올해 연말 한글 딱지본 소설 300여 책(약 30,000면)의 텍스트 데이터를 추가 개방하는 등 향후에도 데이터 구축과 개방을 지속 확대하고 인공지능(AI) 활용 서비스를 고도화하여, ‘공유서재’를 지속적으로 성장할 수 있는 데이터 플랫폼으로 발전시켜 나갈 계획이다.

국립중앙도서관 디지털정보기획과 이현주 과장은 “이번 인공지능(AI) 학습데이터 개방은 도서관의 방대한 지식자원을 인공지능 시대의 핵심 인프라로 전환하는 중요한 시작점”이라며, “앞으로 데이터 개방 범위를 꾸준히 넓혀, 국민 누구나 공공 지식자원의 혜택을 누릴 수 있는 인공지능(AI) 시대의 도서관을 만들어가겠다.”라고 밝혔다.

출처: https://www.nl.go.kr/NL/contents/N50603000000.do?schM=view&id=59077&schBcid=normal0302

댓글 남기기