전체기사 최신뉴스 GAM 라씨로
KYD 디데이
문화·연예 문화·연예일반

속보

더보기

문체부·국립국어원 '챗GPT 말뭉치 사업' 긴급진단…현주소는?

기사입력 : 2023년03월17일 10:39

최종수정 : 2023년03월17일 15:19

문체부, 국어원과 'K-챗GPT' 저작권·활용방안 논의
국립국어원, K-GPT 개발 지원 '말뭉치' 사업
이달 말 '모두의 말뭉치' 영문판 홈페이지 개통
말뭉치 사업, 올바른 한국 정보 알리기 위한 기초 작업

[서울=뉴스핌] 이현경 기자 = 한국형 챗GPT 개발을 지원하는 국립국어원이 이달 말 '모두의 말뭉치' 홈페이지의 영문판을 개통한다.

'모두의 말뭉치'는 국립국어원이 거대 인공지능(AI) 기술에 활용될 언어 자료를 공식적으로 게시하는 온라인 공간이다. '모두의 말뭉치'의 영문판 홈페이지 구축은 한국 관련 정보의 오류 발생을 줄일 수 있는 발판을 마련한 것으로 해석된다. 

국어원에 따르면 '말뭉치 사업'은 고차원적인 한국어를 이해할 수 있는 자료인 동시에 저작권이 해결된 정보이기 때문에 기존 챗GPT가 소개하는 한국 정보보다 신뢰성도 높다. 이에 잘못된 한국 정보를 바로 잡는데 기여할 것으로 기대한다.  

[서울=뉴스핌] 이현경 기자 = 국립국어원의 '모두의 말뭉치' 홈페이지 2023.03.17 89hklee@newspim.com

유희정 국립국어원 언어정보과 학예연구사는 뉴스핌을 통해 "3월 말까지 '모두의 말뭉치' 영문 페이지를 개통하고,  올해 안으로 외국인 이용자의 홈페이지 회원가입 간소화를 위한 작업도 추진한다"고 밝혔다.

현재 '모두의 말뭉치' 홈페이지는 국문판만 개설돼 있다. 이곳에서도 국내외인 상관 없이 회원가입만 하면 국어원이 제공하는 한국어 말뭉치 자료를 내려받아 사용·활용할 수 있다. 가입 과정에서 휴대폰 번호를 통한 본인 인증이 필요한데, 외국인은 불가하기 때문에 그간 이메일이나 우편을 통한 서면 자료를 제출해야 하는 불편함이 있었다. 올해 내로 이 과정을 간소화해 외국인도 편리하게 한국어 말뭉치 자료를 활용할 수 있게 됐다.

장소원 국립국어원장은 말뭉치 사업이 한국에 대한 정확한 정보를 해외에 전하는데 도움이 될 것이라고 강조했다. 현재 공개된 챗GPT의 한국어 이해 능력과 한국에 대해 설명하는 정보는 신뢰할 수 없다는 평가다.

장 원장은 "한국어 챗GPT를 잘 만들려면 한국어 말뭉치를 잘 만들어야 한다"며 "챗GPT-4의 한국어 능력은 이전보다 나아졌지만, 앞선 세대는 잘못된 정보가 많았다. '국립국어원장이 누구냐'고 물으니 '김영권 교수'라며 거짓 정보를 말하더라"라고 말했다.

이어 "우리나라에 대한 정보를 잘 전달하기 위해서 말뭉치 사업이 필요하다"면서 "아직은 (오픈AI의)챗GPT 수준이 신뢰할 정도는 아니다. 잘 모르면 모르겠다고 하면 좋겠는데 지어내기도 한다"며 "미국에서 만든 챗GPT이기 때문에 한국어 말뭉치를 어디에서 가져온 것인지도 모른다. 국어원의 말뭉치 사업은 정교하고 고차원적인 해석이 가능하도록 하는 말뭉치 작업이기 때문에 한국어 능력과 정보에 대한 신뢰성을 올릴 수 있다. 또한 대기업, 작은 기업도 모두 활용할 수 있다"고 언급했다.

◆ 챗GPT 열풍… 문체부·국어원 K-GPT 개발 지원

[사진=게티이미지뱅크]

전 세계적으로 초거대 인공지능(AI)시대가 본격적으로 개막했다. 지난해 11월 미국의 인공지능 연구개발 기업 오픈AI가 개발한 챗GPT가 세상에 공개되면서다. AI의 인간을 뛰어넘는 학습 능력은 모두가 인정하는 부분이지만 자연스러운 언어 구사를 통한 소통은 신기술의 발전으로 평가된다.

챗GPT의 성능이 입증된지 불과 6개월도 채 되지 않은 지난 14일(현지시각)에는 인공지능 챗봇 '챗GPT'의 능력이 한 단계 더 향상됐다는 소식이 전해졌다. 오픈AI는 GPT-4를 공개하고 챗GPT가 문자뿐 아니라 사람의 손글씨, 이미지도 인식하고 이전보다 오류 발생률이 줄었다고 밝혔다. 앞서 11월에 공개된 GPT-3.5에 비해 GPT-4는 기존 회당 3000단어에서 2만5000단어를 처리할 정도로 수행력이 높아졌으며, 특히 한국어 처리 이해 정확도를 77%로 끌어 올리며 높은 성능을 자랑했다.

전 세계적인 챗GPT 열풍에 발맞춰 올해 2월 문체부는 국립국어원과 함께 추진하는 '한국어를 잘하는 K-챗GPT' 개발을 지원한다고 밝혔다. 이에 지난달 24일 AI 등 신기술 관련 저작권, 활용방안과 관련해 논의할 워킹그룹을 발족했다. 이 워킹그룹은 2027년까지 한국어 특성을 반영한 고품질 말뭉치 10억 어절 구축 계획을 세울 예정이다. 

올해는 한국형 챗GPT가 빠르게 개발될 수 있도록 25종, 약 1억2000만 어절의 고품질 한국어 말뭉치를 구축해 배포한다. 국어원에 따르면 4월 중 25종 말뭉치 사업과 관련한 발주를 마무리하고 5월 중 계약까지 체결한 후 수립된 올해 계획이 시행된다.

유희정 국어원 학예연구사는 "챗GPT-4가 올해 나온다는 건 지난해 말부터 예측이 됐다. 최근 챗GPT를 사용해보면 알겠지만 한국어로 소통이 가능하지만 한국에 대한 정보, 한국 문화와 한국어에 대한 이해는 뛰어나지 않다"고 평가했다.

◆ 국어원, '저작권' 문제 해결된 말뭉치 자료

국어원이 추진하는 말뭉치 사업은 AI가 '고차원적'인 한국어 처리 능력을 할 수 있도록 하는 밑바탕 작업이다. 국어원은 2018년부터 대규모 한국어 말뭉치 사업을 시작해 37종(약 22억 어절)을 공개 사이트인 '모두의 말뭉치' 통해 제공하며 한국어 인공지능 개발에 활용되고 있다.

고품질의 말뭉치는 사람이 직접 말뭉치에 한국어 분석 정보(어휘 의미, 구문, 개체명, 감성 등)를 입력하고 검수하는 과정을 거치는데, 이 과정에 비용이 많이 들기 때문에 한국어 말뭉치 제공은 스타트업의 언어자료 구축 비용 절감과 개발된 인공지능 기술의 고도화에 기여하고 있다.

국어원이 제공하는 '말뭉치'는 '저작권' 문제가 해결된 자료다. 여러 분야의 정보를 제공하는 AI의 학습을 위해 다양한 방면의 자료가 필요하다보니 자료 수집 과정에서 중복된 자료, 거짓 정보까지 포함된다. 여기에 출처가 분명하지 않으면 저작권 문제까지 번질 수 있다. 누구나 자료를 쓸 수 있게 하기 위해 저작권 문제에 집중하고 있으며 예산도 저작권 관련 비중이 가장 높다. 

유희정 연구사는 "실제로 웹크롤링(웹 검색을 통해 추출하는 자료)을 통한 공개된 데이터를 개발과 연구에 사용할 때 윤리적인 문제나 저작권 문제가 발생한다"고 말했다.

이어 "저작권을 확보한 자료를 수집하더라도 인공지능이 학습할 수 있는 형식으로 가공이 필요한데 이 작업을 국어원에서 한다"며 "인공지능 모델이 한국어를 처리하기 위해 이 자료를 어떤 뜻으로 해석해야 하고 어떤 문장으로 분석해야하는 지 등의 지침을 만들고 데이터화하는 작업까지 한다"라고 소개했다. 

유 연구사는 "카카오나 네이버와 같은 대기업은 AI 모델에 학습시킬 다양한 한국어 자료를 확보할 사정이 되지만 이에 비해 중소기업이나 스타트업은 거대 데이터 수집이 힘들고, 이 과정에서 자료가 중복되거나 사실이 아니거나 저작권이나 윤리적인 문제가 일어날 수 있다"며 "국어원이 제공하는 자료는 저작권과 관련해서는 안심하고 사용할 수 있다"고 덧붙였다. 

89hklee@newspim.com

[뉴스핌 베스트 기사]

사진
의료정책연구원장 "의대 안식년 필요" [서울=뉴스핌] 조준경 기자 = 오는 14일 국회 보건복지위원회가 주최하는 '의료인력 수급추계기구 법제화를 위한 공청회'가 예정된 가운데, 의료계 측 참석 인사인 안덕선 대한의사협회 의료정책연구원장이 7일 "정원이 크게 늘어난 의대는 안식년이 필요하다"고 밝혔다. 안 원장은 이날 뉴스핌과의 통화에서 "정원을 늘리지 않은 대학은 예년처럼 뽑아도 상관이 없겠지만, 크게 증원된 대학은 1년 정도는 이 사태를 수습할 안식년이 필요하다"고 말했다. [서울=뉴스핌] 조준경 기자 = 대한의사협회 공청회에서는 복지위 여야 의원들이 의료인력 수급추계위원회 구성과 관련한 법안에 대해 전문가 의견을 청취할 예정이다. 현재 복지위에 계류된 관련 법안은 더불어민주당 강선우, 김윤 의원이 각각 대표 발의한 보건의료인력지원법 개정안과 국민의힘 김미애 의원이 대표 발의한 보건의료기본법 개정안이 있다. 공청회에서는 법 개정안과 추계위 설치에 구성 방안 및 권한 설정에 대한 의견 교환이 이뤄질 전망이다.  의료인력수급추계는 추계위가 구성된 이후가 순서지만, 의료계에선 휴학한 의대생들을 복학시키기 위해선 2026학년도 의대정원에 대한 정부의 결단이 필요하다는 입장이다. 일각에선 2026학년도 의대정원 감원부터 모집 중단까지 다양한 의견이 나오고 있다. 강선우 의원 안에는 2026학년도 의대 정원을 조정할 수 있으며 특히 '전(前) 학년도 증원 규모에 따른 사회적 부작용 등을 이유로 증원 규모의 조정이 필요한 때 이를 조정하거나 정원을 감원할 수 있다'는 부칙이 포함됐다. 안 원장은 "도쿄대도 '69학번'이 통째로 없다. 학교가 소요사태 이후 정리를 하기 위해 과감하게 1년 안식년을 얻었던 것"이라며 "필요하면 과감한 조치로 충격을 완화시켜야 한다"고 말했다. 안 원장이 언급한 '도쿄대 69학번'은 지난 1968년 도쿄대 의학부에서 인턴 처우 문제 등을 두고 발생한 분쟁이 전체 학부로 퍼지면서 전교생이 유급되고, 이듬해 입시를 시행하지 않았던 사건이다. 한편 의협 측은 공청회를 앞두고 2026학년도 의대정원과 관련된 내부 방향성에 대해서는 함구했다. 김성근 대변인은 "내부적으로 정리돼 발표할 내용은 아직 없다"면서, "(공청회에서는) 제출된 법안에 대한 내용만 이야기할 것"이라고 밝혔다. calebcao@newspim.com 2025-02-07 16:12
사진
"트럼프, 中 특별교역국 박탈 가능성" [서울=뉴스핌] 박공식 기자 = 미국과 중국 사이에 자존심을 건 관세전쟁이 계속 고조될 경우 트럼프 행정부가 중국에 부여한 특별교역국(PNTR:Permanent Normal Trade Relations, 영구정상교역관계) 지위까지 박탈해 중국에 대한 관세를 평균 61%까지 올릴 가능성이 있다고 로이터통신이 무역전문가들을 인용해 5일(현지시간) 보도했다. 통신은 도널드 트럼프 대통령이 취임 첫날(1월20일) 하워드 러트닉 상무장관 지명자와 제이미슨 그리어 미 무역대표부(USTR) 대표 지명자에게 중국의 특별교역국 지위와 관련한 입법적 조치를 검토하라고 지시했다고 전했다. PNTR은 이전 '최혜국대우(most-favored-nation treatment)'로 불려진 것으로, 관세와 항해 등 양국간 관계에서 제3국에 부여한 조건보다 절대 불리하지 않은 대우를 하는 것이다. 세계무역기구(WTO)가 교역의 일반원칙으로 지지하고 있다. 미국은 2000년 중국의 WTO 가입 전 중국에 PNTR 지위를 부여했다. 이후 중국의 대미수출은 급격하게 증가했다. 트럼프 대통령의 중국에 대한 PNTR 지위 재검토 지시 이후 존 물레나 공화당 의원과 톰 스워지 민주당 의원은 지난 1월 23일 하원에 공정무역복원법안(Restoring Trade Fairness Act)을 공동발의했다. 물레나 의원은 하원 중국관련특별위원회의 공화당 의장을 맡고 있다. 상원에도 동시 발의된 법안은 중국과 정상교역 관계를 중단하고 관세를 5년간 35~100% 수준으로 인상하는 내용을 담고 있다. 비슷한 법안은 과거에도 여러 차례 의회에서 발의됐지만 충분한 지지를 얻지 못해 폐기됐다. 그러나 이번에는 사정이 다르다. 무역 전문가들은 민주 공화 양당 지지가 점점 확산돼 통과될 가능성이 높아지고 있다고 말했다. 미국 싱크탱크 전략국제문제연구소(CSIS)의 짐 루이스 부소장은 중국이 글로벌 무역규칙을 따르지 않아 PNTR 지위가 박탈될 가능성이 커지고 있다고 진단하고 "트럼프는 중국과 어떤 거래를 할수 있을지 지켜보며 모든 가능성을 열어두고 있다"고 말했다. 또다른 기업 컨설턴트와 법률가는 거래 기업들이 중국의 PNTR 지위 상실 가능성에 대비하고 있다고 전했다. 공급망을 중국 바깥(제3국)으로 이전하거나 외국인 직원을 귀국시키고 중국내 신규 투자를 중단하고 있다고 했다. 추가 관세 부담을 전가하기 위해 납품 계약 조건을 재협상하는 기업도 있다고 덧붙였다. 영국의 경제연구소인 옥스퍼드 이코노믹스는 무역단체인 미중무역위원회(USCBC:U.S.-China Business Council)에 제출한 보고서에서 중국이 PNTR 지위를 상실하면 연료를 제외한 모든 중국산 제품은 미국 기업이 중국에서 생산했더라도 관세가 현재 19%에서 평균 61%까지 오를 수 있다고 예상했다. USCBC는 "중국에 대한 PNTR 지위 박탈은 중국의 무역 관행을 바꾸는 수단으로 적절하지 않으며 미국이 가진 다른 수단을 사용해야 한다"고 반대 입장을 표명했다. 현지시간 2월4일 0시1분을 기해 트럼프 행정부의 대중국 관세 10%가 발효되자 중국도 즉각 보복 관세 조치로 맞섰다. 지난해 대선 과정에서 트럼프 대통령은 중국에 최대 60% 관세를 부과할 것이라고 공언한 바 있다. 한편 싱크탱크 미국기업연구소(AEI:American Enterprise Institute) 선임연구원 데렉 시저스는 "공화당 의원들은 트럼프 대통령의 승인없이는 PNTR 취소 법안을 통과시키지 않을 것"이라고 예상했다. 현재 미국과 정상적 교역국 지위를 가지지 못한 나라는 쿠바와 북한, 벨라루스, 러시아 등 4개국 뿐이다. 3일 미국 캘리포니아주 오클랜드 항구에 접근하는 콘테이너 화물선 [사진=로이터] kongsikpark@newspim.com 2025-02-06 13:54
안다쇼핑
Top으로 이동