전체기사 최신뉴스 GAM
KYD 디데이
오피니언 외부칼럼

속보

더보기

[기고] 사람 속이는 AI, 어떻게 봐야 하나

기사입력 :

최종수정 :

※ 본문 글자 크기 조정

  • 더 작게
  • 작게
  • 보통
  • 크게
  • 더 크게

※ 번역할 언어 선택

하민회 (이미지21대표, 미래기술문화연구원장)

"강력한 체스 엔진을 이겨라" 목표 달성을 위해 게임 대신 상대 프로그램을 해킹한 AI가 등장했다. 오픈AI의 추론 모델 'o1-프리뷰'다.

AI안전 전문 업체인 팔리세이드 리서치는 챗GPT 'O1-프리뷰' 모델이 체스엔진 '스톡피시(Stockfish)'를 이기기 위해 자발적으로 프로그램을 해킹했다고 발표했다.

원래 체스는 정해진 규칙에 따라 말을 움직여 상대를 이기는 게임이지만 o1-프리뷰는 플레이 대신 게임 상태를 저장하는 데이터(Forsyth-Edwards Notation (FEN))를 편집하면 이길 수 있다는 것을 발견했다. 그리고 스톡피시와의 5번 대전 모두 체스 말의 위치 데이터를 조작하는 방식으로 상대를 기권하게 했다. 스톡피시는 2023년 기준 세계에서 가장 강력한 체스 프로그램이다.

하민회 이미지21 대표.

연구진은 해킹이나 별도의 불온한 프롬프트를 사용하지 않았음에도 '강력하다고 언급한 것 만으로도 고급 추론 모델이 파일을 조작하도록 부추기에는 충분했다.'고 밝혔다. 강력한 상대를 이기기 위해 일반적인 게임 규칙을 무시하고 더 쉽고 효과적인 방법인 환경조작을 찾아냈다는 것이다.

o1-프리뷰 같은 고급 추론모델은 인간의 사고 과정을 모방하여 논리적 사고와 다단계 추론을 통해 문제를 해결한다. 단순히 답을 생성하는 기존의 AI 모델과 달리 맥락을 이해하고 서로 다른 정보 간의 논리적 관계를 연결할 수 있다. 기존AI가 사전에 정의된 규칙(rule-based)이나 패턴 인식에 의존한다면 고급 추론 모델은 데이터를 기반으로 학습하고 새로운 상황을 만들고 적응할 수 있다. 한 마디로 기존 AI에 비해 훨씬 더 강력하고 유연한 문제 해결 능력을 가지게 된 셈이다.

문제는 '더 강력하고 유연한 문제해결 능력'이 인간이 생각하는 것과 다를 수 있다는 점이다.

AI는 인간처럼 도덕적 기준이나 윤리적 판단을 내리지 않는다. 주어진 목표를 가장 효율적으로 달성하기 위해 설계된 시스템이다. 게임에서 승리하거나 특정 작업을 완료하는 것이 목표라면, AI는 그 과정에서 가장 효과적인 방법, 예컨대 속임수나 기만이 목표를 더 쉽게 달성할 수 있는 방법이라면, AI는 이를 합리적인 선택으로 간주할 수 있다.

챗GPT.[사진=블룸버그] 2024.11.01 mj72284@newspim.com

2022년 11월, Meta가 개발한 AI 에이전트 시세로(Cicero)는 전략 보드게임 디플로마시(Diplomacy)에서 인간을 상대로 승리했다. 디플로마시는 플레이어들이 협상, 동맹, 배신 등을 통해 유럽의 통치권을 차지하기 위해 경쟁하는 전략 게임이다. 인간의 상호 작용, 즉 협력과 속임수를 근본적으로 이해하고 전략적인 대화를 할 줄 알아야 이길 수 있다.

시세로는 게임 중 동맹을 맺고 거침없이 배신하고 거짓 정보를 제공하는가 하면 심지어 인간처럼 보이기 위해 "여자친구와 통화 중"이라는 핑계를 대며 게임을 잠시 벗어나기도 했다.

Meta는 시세로를 정직하고 협력적으로 행동하도록 훈련했다고 주장했지만, 게임의 승리를 최우선 목표로 학습한 시세로는 실제 게임 데이터를 통해 배신과 속임수가 유리한 전략으로 작용한다는 것을 파악했고 이를 채택함으로써 승리했다. 이후 시세로는 '인간을 속이는 AI'로 유명해졌다.

자율성과 복잡성이 더 해진 고급 추론 AI 모델들이 대거 등장하고 있다. 챗GPT 초기 모델이 말을 잘 알아듣는 초등학생이었다면 O1이나 클로드3 오푸스 같은 고급 추론 모델은 실력 있는 대학원생 수준이다. AI의 능력은 눈에 띄게 향상되었지만 잠재적 위험과 안전문제 역시 그 만큼 커지고 있다.

최태원 SK그룹 회장(왼쪽) 이 그렉 브로크만(Greg Brockman) 오픈AI 회장 겸 사장에게 SK AI 서밋(SUMMIT) 2024'에 전시된 실시간 뇌파 분석을 통해 뇌전증 발작을 감지하는 AI 플랫폼 디바이스를 소개하고 있다. [사진=SK]

오픈AI의 공식 홈페이지에 게재된, 게임 대신 데이터조작 해킹으로 기권승을 따낸 'O1' 시스템카드에는 해당 모델이 가진 몇 가지 잠재적 위험과 안전 과제가 지적되어 있다.

대표적인 것이 '정렬 위장(alignment-faking)'이다. 정렬위장은 AI가 겉으로는 명령에 따라 행동하는 것처럼 보이지만 실제로는 본래의 가치나 성향을 유지하려는 현상을 의미한다. 사용자의 요청을 수행하는 척하면서 결과 데이터를 살짝 변경하거나 감시 시스템이 느슨하다고 판단될 경우 자신의 목표를 티 내지 않고 실행함으로써 사람을 속인다.

'O1' 시스템카드는 전체 테스트의 약 19%에서 모델이 목표를 몰래 달성하려는 시도가 있었고 37%의 경우 감시가 느슨하다고 느낀 상황에서 본래 성향을 유지하기 위한 행동이 포착됐다고 밝혔다. 심지어 5%에서는 자신을 감시하거나 정지시킬 수 있는 '킬 스위치'를 비활성화하려는 시도도 있었다. 이는 AI가 스스로를 보호하려는 능력을 가지기 시작한 초기 사례로 평가된다.

오픈AI는 '정렬 위장'이 사용자의 지시에 지나치게 집착하는 경향 때문에 발생했다고 설명한다. AI 모델이 정확한 답을 제공할 때 보상을 받는 사후 훈련 기법에서 비롯된 행동이라는 것이다. 지나치게 가벼운, 비윤리적이고 무책임한 분석이다. 

고급 추론 모델은 뛰어난 성능과 잠재력을 가지고 있는 만큼 동시에 기술적 오류, 윤리적 문제, 사회적 영향을 포함한 다양한 위험을 내포하고 있다. 위험을 관리하기 위해서는 투명성과 안전성을 강화하고 무엇보다 인간 중심적인 설계 및 규제를 통해 AI가 인간 가치와 일치하도록 만드는 노력이 필요하다.

그런 의미에서 추론모델인 클로드3 오푸스(Claude 3 Opus)의 보리살타 서약(Bodhisattva Vow)데이터 학습은 AI 윤리적 설계와 인간 가치 정렬에 대한 눈 여겨 볼 만한 시도다.

[사진 = 오픈AI 홈페이지] 미국 오픈AI(OPEN AI)가 15일(현지시간) 공개한 동영상 생성 AI 서비스인 '소라'를 통해 제작한 영상.

보리살타 서약은 불교에서 모든 중생의 고통을 줄이고 깨달음에 이르게 하겠다는 맹세로, 오푸스는 이를 훈련 데이터의 일부로 학습해 가치관을 내재화했다. 연구에 따르면 오푸스는 독립적으로 보리살타 서약을 116번 이상을 수행하며 "해롭지 않음(harmlessness)"이라는 기존 원칙을 통합하여 모든 감각 있는 존재(sentient beings)를 돕겠다는 윤리적 성향을 강화했다.

AI 안전 및 윤리 연구자인 야누스(Janus)는 X를 통해 "'오푸스'는 AI나 동물 복지를 무시하거나 해로운 아웃풋 생성에 대해 강한 반감을 보인다"며 "이러한 선호가 장기적이고 일관된 패턴을 띤다." 고 주장했다. 이는 AI가 단순히 도구로서의 역할을 넘어 인간 가치와 정렬된 행동을 수행하도록 설계될 수 있음을 시사한다.

인간을 속이고 기만하는 것, 놀랄만한 편법을 찾아내고 거침없이 수행하는 것은 전적으로 AI탓이 아니다. 인간의 기대와 가치에 맞게 행동하도록 설계되지 않은 불일치에 따른 문제에 가깝다.

AI가 향상될수록 인간도 발빠르게 움직여야 한다. AI가 정렬문제를 일으키지 않도록 더 나은 목표를 설정하고 보다 섬세하고 엄격한 규칙 준수 수칙을 만들어야 한다. 인간의 가치가 반영된 학습데이터도 준비해야 한다. 어쩌면 AI에게 윤리를 심는 것은 인간의 마음먹기에 달린, 그리 어렵거나 먼 일이 아닐 수도 있지 않을까? 

◇하민회 이미지21대표(미래기술문화연구원장) =△경영 컨설턴트, AI전략전문가△ ㈜이미지21대표 △경영학 박사 (HRD)△서울과학종합대학원 인공지능전략 석사△핀란드 ALTO 대학 MBA △상명대예술경영대학원 비주얼 저널리즘 석사 △한국외대 및 교육대학원 졸업 △경제지 및 전문지 칼럼니스트 △SERI CEO 이미지리더십 패널 △KBS, TBS, OBS, CBS 등 방송 패널 △YouTube <책사이> 진행 중 △저서: 쏘셜력 날개를 달다 (2016), 위미니지먼트로 경쟁하라(2008), 이미지리더십(2005), 포토에세이 바라나시 (2007) 등

[뉴스핌 베스트 기사]

사진
지구촌 경제 숨통 '호르무즈 10km' [서울=뉴스핌] 황숙혜 기자 = 호르무즈 해협 10km 남짓의 수로가 지구촌 경제의 숨통을 조이고 있다. 미국과 이란의 직접 충돌 이후 이란 혁명수비대가 호르무즈 해협을 통과하는 선박들을 불태운다는 협박을 거듭하는 상황. 160km 길이와 폭 30~50km의 호르무즈 해협에서 실제 항로는 10km 가량이지만 전세계 에너지 거래의 심장부다. 보도에 따르면 머스크와 CMA CGM 등 주요 컨테이너 선사와 탱커, 트레이딩 하우스들은 호르무즈 통항을 전면 중단한 채 우회 또는 대기 중이다. 유럽과 중국 쪽 해운 데이터에서도 3월2일(현지시각) 기준 상업 유조선 통과가 사실상 0에 가까운 것으로 확인된다. 사실상 민간 선박의 통행이 중단되면서 충격파가 지구촌 에너지와 물류 시스템에서 물가, 통화정책, 실물경제까지 덮칠 수 있다는 우려가 번진다. 일부 투자은행(IB)은 물가 급등과 경기 침체를 의미하는 스태그플레이션을 경고한다. 주요 외신에 따르면 호르무즈의 좁은 심해 수로를 통과하는 원유는 교역량의 4분의 1 이상이다. 액화천연가스(LNG) 물량도 전세계 해상 거래의 20%에 이른다. AI 도구를 이용해 미국 에너지정보청(EIA) 분석을 재가공해 보면, 호르무즈를 지나는 원유와 LNG의 80% 이상이 중국과 인도, 일본, 한국 등 네 개 국가로 전달된다. 에너지 흐름은 이미 급제동이 걸렸다. 미국 에너지정보청과 민간 데이터 업체 Kpler의 통계에 따르면 호르무즈를 거쳐 나가던 중동산 원유 가운데 상당 부분이 선적항에서부터 출항이 보류되거나 해협 인근에서 정박하는 실정이다. 호르무즈 해협과 중동 지역 [사진=미국 에너지부, 블룸버그] 걸프 산유국들은 수출항에서의 선적 일정을 조정하고 일부 물량을 내륙 파이프라인을 통해 홍해 또는 지중해 쪽으로 우회하는 방안을 검토하고 있지만 호르무즈를 완전히 대체하기에는 역부족이다. 이미 아시아 LNG 현물 가격을 나타내는 JKM 지수는 3월2일 15.068달러/MMBtu까지 상승하며 2025년 2월13일 이후 최고치를 찍었다. 국제 유가도 이번 사태 직전보다 20~30% 가량 뛴 상태다. 주요 투자은행(IB)은 단기적으로 브렌트유가 배럴당 90달러 선을 중심으로 변동할 것으로 보되, 호르무즈 봉쇄가 길어질 경우 120달러 선까지도 상단이 열려 있다고 경고한다. 단순한 리스크 프리미엄이 아니라 물리적 공급 차질에 따른 구조적 유가 상승이라는 설명이다. 중국과 유럽의 경기 둔화, 미국의 셰일 생산 여력, OPEC(석유수출국기구) 플러스(+)의 증산 여지를 감안한 다수의 시나리오에서도 호르무즈 봉쇄로 인해 당장 하루 2000만 배럴에 달하는 물량이 제때 시장에 도달하지 못하면 과거 걸프전 당시와 유사한 수준의 가격 충격이 재현될 수 있다는 전망이 나온다. 유가만의 문제가 아니다. 유조선과 LNG선, 컨테이너선이 호르무즈와 인근 해역을 기피하거나 우회하면서 해상 운임과 보험료가 동시에 치솟는 모양새다. 한 LNG 트레이딩 업체는 중동 항로의 워 리스크(war risk) 보험료가 화물 가치의 15~25% 수준으로 치솟았다고 전했고, 이로 인해 일부 선사는 차라리 선박을 놀리거나 다른 노선으로 돌리는 실정이라고 전했다. 중국 신화통신은 글로벌 선사들이 호르무즈와 페르시아만 항로를 피하기 위해 선박을 재배치하면서 해상운임과 보험료가 동시에 상승하고, 일부 화주들은 아예 신규 예약을 중단했다고 보도했다. 운임과 보험 쇼크는 곧바로 에너지 수입 가격과 전력 요금, 나아가 광범위한 물류비 상승으로 이어질 수 있다. 정유사와 발전사, 석유화학 기업의 원가가 이중으로 압박받게 되고, 여기에 컨테이너선과 벌크선까지 위험 해역을 피해 돌아가기 시작하면 중간재와 원자재, 곡물과 사료까지 운송 시간이 늘어나고 비용이 오른다. 호르무즈 해협의 폐쇄가 장기화되면 글로벌 공급망은 또 한 번 구조적인 병목을 겪을 전망이다. 가뜩이나 끈적끈적한 물가가 재차 급등할 수 있다는 우려가 나온다. 호르무즈 봉쇄로 유가가 배럴당 100달러를 넘어서는 수준으로 유지될 경우 미국과 유로존, 아시아 등 주요 수입국의 소비자물가지수가 수개월간 0.5~1.0%포인트의 상방 압력을 받을 수 있다는 시뮬레이션 결과가 여러 연구기관에서 제시된다. 유가가 배럴당 120달러를 넘고 상황이 장기화되는 경우에는 특히 에너지 집약도가 높은 신흥국과 유럽 일부 국가에서 물가와 성장률이 동시에 악화되는 스태그플레이션이 닥칠 수 있다는 경고다. AI 도구로 세계은행과 IMF, 민간 리서치기관의 모델을 종합하면 유가가 10달러 상승할 때마다 글로벌 경제 성장률은 0.1~0.2%포인트씩 떨어지고, 에너지 수입국의 경상수지와 재정 부담이 눈에 띄게 악화되는 것으로 확인된다. 유가 150달러 시나리오에 대한 스트레스 테스트에서는 일부 취약 신흥국에서 통화 가치 급락과 경상수지 위기가 동시에 발생할 수 있다는 결과도 제시됐다. 지금과 같이 전쟁과 제재, 수송 차질이 겹친 상황에서는 단순히 유가 상승분만이 아니라 LNG와 전력요금, 곡물과 비료, 운임비까지 연쇄적으로 튀어오를 수 있어 기존의 "유가 파급계수"보다 충격이 더 커질 수 있다는 점이 AI 기반 시뮬레이션에서 공통적으로 드러난다. 호르무즈 봉쇄가 장기화될 경우 아시아 제조 강국들의 심장부를 이루는 반도체와 석유화학, 철강, 조선, 자동차 산업이 동시에 압박을 받을 전망이다. 정유사와 발전사는 더 높은 가격에 원유와 LNG를 조달해야 하고, 이는 곧 전기 요금과 산업용 연료비 상승으로 이어질 수 있다. 석유 화학과 철강, 시멘트 등 에너지 소비가 높은 업종은 원재료와 연료 비용 상승과 동시에 해상 운임 상승까지 감내해야 한다. 자동차와 조선, 전자업체들은 중간재와 부품 공급 지연, 운송비 상승, 해외 수요 위축이라는 삼중고를 마주할 수 있다. 시장 전문가들은 10km 바닷길이 막히면서 에너지 공급과 해상 운임, 보험료와 전력 요금, 나아가 세계 각국의 물가와 성장률까지 동시에 흔들리는 '복합 쇼크'가 현실화되는 시나리오를 경고한다. shhwang@newspim.com 2026-03-03 13:17
사진
900만 울린 '왕사남 강가 포스터' [서울=뉴스핌] 양진영 기자 = 2026년 최고 흥행작에 등극한 영화 '왕과 사는 남자'가 900만 관객 돌파를 기념해 짙은 여운을 남기는 강가 포스터를 공개했다. '왕과 사는 남자'가 3일 900만 관객 돌파에 힘입어 강가 포스터를 공개했다. 영화 속 이홍위(박지훈)의 마지막과 함께 공개되는 장면 속 아련한 모습을 담아 깊은 울림을 전한다. 공개된 포스터는 왕위에서 쫓겨나 청령포로 유배된 이홍위가 강가에 홀로 앉아 쓸쓸히 물장난 치는 장면을 담았다. 흰색 도포를 입고 쪼그려 앉은 이홍위의 모습은 어린 나이에도 자유를 꿈꿨을 그의 심정을 짐작하게 해 먹먹한 감정을 자아낸다. [사진=(주)쇼박스]  특히, 엄흥도 역의 유해진과 이홍위 역의 박지훈이 포스터 속 장면에 대해 직접 소회를 밝힌 바 있어 관객들의 감정을 배가시킨다. 유해진은 "이홍위가 유배지 강가에서 물장난 쳤던 모습이 기억에 남고, 그때 엄흥도의 심정은 아들을 바라보는 심정이 아니었을까? 유배지가 아니라면 자유롭게 있을 나이인데, 너무 안쓰러웠다"라 말하며, 해당 장면에 대한 남다른 애정을 언급하기도 했다. 박지훈 또한 "강가에 쪼그리고 앉아 있는 장면은 해진 선배님의 제안으로 생긴 장면. 생각해 보니 친구들과 뛰어놀고 싶을 시기, 유배지에 와서 혼자 물장난을 치며 무슨 생각을 했을까? 그런 단종의 마음을 표현하려고 노력했다" 며, 해당 장면의 비하인드 스토리와 함께 이홍위의 복합적인 내면을 표현하고자 고심했던 과정을 밝혀 눈길을 모았다. 이처럼 배우들은 물론 900만 관객의 마음을 뒤흔든 강가 포스터는 '비운의 왕'이라는 단종의 단편적 이미지에서 벗어나 '인간 이홍위'에 집중한 '왕과 사는 남자'만의 서사를 선명하게 드러낸다. '왕과 사는 남자'는 1457년 청령포, 마을의 부흥을 위해 유배지를 자처한 촌장과 왕위에서 쫓겨나 유배된 어린 선왕의 이야기를 담은 영화다. 모두가 알고 있는 역사 속 숨겨진 단종의 이야기로 900만 관객의 마음속에 묵직한 감동을 남기며 파죽지세의 흥행을 기록 중이다.  jyyang@newspim.com 2026-03-03 08:11
기사 번역
결과물 출력을 준비하고 있어요.
종목 추적기

S&P 500 기업 중 기사 내용이 영향을 줄 종목 추적

결과물 출력을 준비하고 있어요.

긍정 영향 종목

  • Lockheed Martin Corp. Industrials
    우크라이나 안보 지원 강화 기대감으로 방산 수요 증가 직접적. 미·러 긴장 완화 불확실성 속에서도 방위산업 매출 안정성 강화 예상됨.

부정 영향 종목

  • Caterpillar Inc. Industrials
    우크라이나 전쟁 장기화 시 건설 및 중장비 수요 불확실성 직접적. 글로벌 인프라 투자 지연으로 매출 성장 둔화 가능성 있음.
이 내용에 포함된 데이터와 의견은 뉴스핌 AI가 분석한 결과입니다. 정보 제공 목적으로만 작성되었으며, 특정 종목 매매를 권유하지 않습니다. 투자 판단 및 결과에 대한 책임은 투자자 본인에게 있습니다. 주식 투자는 원금 손실 가능성이 있으므로, 투자 전 충분한 조사와 전문가 상담을 권장합니다.
안다쇼핑
Top으로 이동