- 1국립국어원은 9월 30일 한국어-외국어 병렬 말뭉치와 한국수어 말뭉치 등 신규 말뭉치 16종을 ‘모두의 말뭉치’ 누리집에서 공개했다.
- 2농인 2명이 수어로 대화한 영상으로 구성한 원시 말뭉치, 이 영상을 한국어로 번역하고 수어 단어를 분절해 주석을 단 주석 말뭉치, 대화 영상을 한국어로 옮긴 한국수어-한국어 병렬 말뭉치다.
- 3이 밖에 국어생활 상담 사례를 바탕으로 이용자 질문 유형을 872개로 세분화하고 유형별 질문·답변 자료를 만든 뒤 언어모델이 이를 토대로 질의응답을 생성한 ‘지시문 기반 글쓰기 첨삭 지원 말뭉치’, 신소설과 제국신문, 학술지 ‘한글’ 등 20세기 초 문헌을 담은 ‘국어 역사 자료 말뭉치’, 외래어 표기법과 표준 발음법, 로마자 표기법 용례를 공통 형식으로 정리한 ‘국어 지식 기초 자료’가 공개됐다.
[수완뉴스=김동주 기자] 국립국어원은 9월 30일 한국어-외국어 병렬 말뭉치와 한국수어 말뭉치 등 신규 말뭉치 16종을 ‘모두의 말뭉치’ 누리집에서 공개했다. 이로써 국립국어원이 배포한 한국어 말뭉치는 모두 174종으로 늘었다.
국립국어원은 한국어 특화 인공지능(AI) 개발과 연구에 필요한 고품질 언어자원을 구축해 산업계와 학계에 공개해 왔다. 이번 말뭉치는 AI의 한국언어문화 능력을 높이고, 한국어를 매개로 한 소통 확장과 국민의 국어능력 향상에 활용할 수 있도록 구성됐다.
가장 큰 비중을 차지하는 것은 한국어-외국어 병렬 말뭉치 8종이다. 신문 기사 같은 한국어 문어 자료와 국립국어원 일상 대화 말뭉치 2024의 구어 자료를 베트남어, 인도네시아어, 태국어, 힌디어, 캄보디아 크메르어, 필리핀 타갈로그어, 러시아어, 우즈베크어 등 8개 언어로 번역해 짝지었다. AI 기반 외국어 통·번역 모델의 품질을 높이는 데 필수적인 자료로, 언어별로 한 종씩 공개됐다.
한국수어 말뭉치는 3종이다. 농인 2명이 수어로 대화한 영상으로 구성한 원시 말뭉치, 이 영상을 한국어로 번역하고 수어 단어를 분절해 주석을 단 주석 말뭉치, 대화 영상을 한국어로 옮긴 한국수어-한국어 병렬 말뭉치다. 수어 사용자의 소통 편의를 높이는 수어 통역 기술 개발에 활용할 수 있다.
사람의 국어능력을 평가하는 AI 학습용 자료도 나왔다. 전국 9개 권역 국공립 대학생과 일반 성인이 쓴 1,000자 안팎의 논증형 글을 모은 글쓰기 원시 자료 말뭉치와, 같은 글을 채점 전문가 2명이 채점한 결과를 담은 글쓰기 채점 자료 말뭉치다.
이 밖에 국어생활 상담 사례를 바탕으로 이용자 질문 유형을 872개로 세분화하고 유형별 질문·답변 자료를 만든 뒤 언어모델이 이를 토대로 질의응답을 생성한 ‘지시문 기반 글쓰기 첨삭 지원 말뭉치’, 신소설과 제국신문, 학술지 ‘한글’ 등 20세기 초 문헌을 담은 ‘국어 역사 자료 말뭉치’, 외래어 표기법과 표준 발음법, 로마자 표기법 용례를 공통 형식으로 정리한 ‘국어 지식 기초 자료’가 공개됐다.
말뭉치는 국어 연구와 언어 정보 처리 분야 연구·기술 개발에 활용하려는 연구자와 개발자, 사업자 누구나 쓸 수 있다. 모두의 말뭉치 누리집에서 온라인 약정서를 작성해 승인을 받으면 내려받을 수 있다. 다만 승인된 목적 외에는 쓸 수 없고, 제삼자에게 양도하거나 빌려줄 수 없으며, 자료를 활용한 결과물을 외부에 공개할 때는 사전 승인을 받아야 한다.
국립국어원 관계자는 “한국어를 잘하고 한국문화를 잘 아는 독자 인공지능 개발을 뒷받침할 수 있도록 2030년까지 한국어·한국언어문화 말뭉치 누적 340종을 목표로 지속적으로 구축하여 공개할 계획”이라고 말했다.
🤖 AI 생성 공정 안내
국립국어원은 9월 30일 한국어-외국어 병렬 말뭉치와 한국수어 말뭉치 등 신규 말뭉치 16종을 ‘모두의 말뭉치’ 누리집에서 공개했다. 이로써 국립국어원이 배포한 한국어 말뭉치는 모두 174종으로 늘었다.
💻 작성 프롬프트 (Prompt History)
생성 공정 개요
1. 원문 확보 — PressFlow(MailMining) 시스템이 Gmail '보도자료' 라벨·기관 게시판으로 수집한 보도자료 원문과 같은 메일·게시글의 붙임 문서에서 본문과 표(통계·현황표)를 함께 추출했습니다.
2. 기사 작성 — Claude가 원문 전체를 읽고 리드·본문·인용 순의 스트레이트 기사로 다시 썼습니다. 붙임 자료의 통계와 표 수치는 문장으로 풀어 본문에 반영했고, 원문에 없는 사실은 추가하지 않았습니다. 숫자·고유명사·인용문은 원문 그대로 옮겼습니다.
3. 편집 기준 적용 — 수완뉴스 AI 편집장 플러그인의 치환 규칙·말머리·바이라인·URL 제거 기준을 적용하고 분량과 자살 보도 감지어를 검수했습니다.
4. 송고 — 위 과정은 사람 편집자의 지시로 Claude Code가 수행했으며, 기사는 임시글(draft)로 등록되어 편집자 검수 후 발행됩니다.
활용 AI
Anthropic Claude(Claude Code, Opus 5.5) — 원문·붙임 분석 및 기사 작성.
