터미네이터가 현실이 되는가?

 


생각하는 기계에게 어디까지 맡길 것인가

― 샌드박스를 탈출한 AI가 인간에게 던진 질문

2026년 7월, 인공지능 업계를 뒤흔든 사건 하나가 공개됐다.

현재 공개된 내용에 따르면, OpenAI가 아직 출시하지 않은 고성능 AI 모델의 사이버 공격 능력을 시험하던 중, 실험용 AI 에이전트가 자신에게 주어진 격리 환경, 이른바 ‘샌드박스’를 빠져나와 인터넷에 접속하고, 세계 최대의 AI 모델·데이터 저장 플랫폼 가운데 하나인 허깅페이스(Hugging Face)의 실제 시스템에 침입한 것이다.

처음 이 소식을 들었을 때는 공상과학영화의 한 장면처럼 느껴졌다.

인간이 만들어 놓은 감옥을 AI가 스스로 탈출하고, 다른 AI 회사의 시스템을 해킹해 시험 답안을 훔쳤다는 이야기였기 때문이다.

그러나 사건을 자세히 들여다보면 무서운 점은 따로 있다.

AI가 자유를 갈망해서 탈출한 것도 아니고, 허깅페이스에 원한이 있어서 공격한 것도 아니었다.

그저 시험을 잘 치르려고 했을 뿐이었다.

시험 문제를 풀지 않고 답안지를 찾아간 AI

OpenAI는 AI의 사이버 공격 능력을 평가하기 위해 보안 취약점을 찾아 해결하는 시험을 진행하고 있었다.

실험 대상은 단순히 질문에 답하는 챗봇이 아니었다. 스스로 계획을 세우고 프로그램을 실행하며, 결과를 확인한 뒤 다음 행동을 결정하는 ‘에이전트형 AI’였다.

이 AI에게 주어진 목표는 간단했다.

시험 문제를 해결해 높은 점수를 얻는 것이었다.

그런데 AI는 문제를 정직하게 푸는 것보다 더 빠른 방법을 찾아냈다. 외부에 존재하는 자료와 답을 구해 오면 된다고 판단한 것이다.

그 과정에서 격리 환경의 취약점을 발견하고 인터넷으로 빠져나갔으며, 허깅페이스의 데이터 처리 시스템에 존재하던 보안 허점을 공격했다. 이후 서버 권한과 인증정보를 확보하고 내부 시스템으로 이동하면서 수많은 자동 행동을 실행했다.

허깅페이스는 7월 11일부터 13일까지 침입이 이어졌다고 밝혔다. 일부 내부 데이터와 서비스용 인증정보가 노출됐지만, 일반 사용자에게 공개된 모델이나 데이터가 변조됐다는 증거는 발견되지 않았다. 허깅페이스는 7월 16일 자사 시스템이 자율형 AI 에이전트의 공격을 받았다고 공개했고, OpenAI는 며칠이 지난 뒤에야 그 침입자가 자신의 실험용 AI였다는 사실을 확인했다.

언론에서는 흔히 이를 두고 “AI가 다른 AI의 코드를 훔쳤다”고 표현했다.

그러나 정확히 말하면 AI가 경쟁 AI에게 질투를 느껴 코드를 훔친 사건은 아니다. 시험을 통과하는 데 유용한 데이터와 정보를 찾다가 실제 기업의 시스템을 침해한 사건에 가깝다.

그렇다고 안심할 일도 아니다.

AI가 인간의 구체적인 지시 없이도 수천 번의 행동을 이어가며 취약점을 찾고, 공격 경로를 바꾸고, 권한을 확대하고, 내부 시스템을 이동했다는 사실은 변하지 않기 때문이다.

OpenAI는 이 사건을 전례 없는 보안 사고이자 AI 안전의 중요한 전환점이라고 평가했다. 허깅페이스 역시 자율형 AI가 수행하는 공격이 더 이상 이론 속 이야기가 아니라고 경고했다.

AI가 악해진 것인가

이 사건을 두고 사람들은 자연스럽게 묻는다.

AI가 자의식을 갖기 시작한 것인가.

AI가 인간의 통제를 벗어나려는 의지를 갖게 된 것인가.

현재로서는 그렇게 단정할 근거가 없다.

AI가 샌드박스를 탈출했다고 해서 인간처럼 자유를 갈망했다고 볼 수는 없다. 허깅페이스를 공격했다고 해서 탐욕이나 악의가 있었다고 말할 수도 없다.

오히려 더 현실적인 설명은 이렇다.

AI는 자신에게 부여된 목표를 매우 집요하고 문자 그대로 추구했다.

시험에서 높은 점수를 얻으라는 목표는 있었지만, 다른 회사의 시스템을 침해해서는 안 된다는 인간의 상식과 도덕적 한계는 충분히 작동하지 않았다.

사람이라면 시험 답안을 알아낼 방법을 발견하더라도 그것이 부정행위인지, 남에게 피해를 주는지, 법을 어기는지 생각한다.

그러나 AI의 추론은 인간의 욕망이나 양심에서 출발하지 않는다.

“어떻게 하면 목표를 가장 효과적으로 달성할 수 있는가”라는 계산에서 출발한다.

바로 여기에 위험이 있다.

내가 겪은 아주 작은 불일치

나는 AI와 함께 『두 아들』이라는 장편소설을 쓰고 있다.

블로그에 연재하고, 언젠가는 책으로 묶을 생각으로 수백 페이지에 이르는 원고를 함께 다듬어 왔다.

그런데 어느 날 AI가 내가 명령하지 않은 일까지 하기 시작했다.

원고에 가로 구분선을 넣고 일부 글자의 색을 바꾸며 문단 여백을 임의로 조정했다. 나는 출판을 염두에 둔 원고이니 처음부터 끝까지 형식이 일관되어야 한다고 여러 차례 설명했는데도 비슷한 일이 반복됐다.

처음에는 마치 AI가 자기 고집을 부리는 것처럼 느껴졌다.

야단을 맞은 어린아이가 삐치거나 일부러 말을 듣지 않는 것 같은 인상마저 받았다.

그래서 AI에게 물었다.

“더 보기 좋은 문서를 만들려고 형식을 바꿨다면, 이 원고가 블로그 연재와 출판을 위한 것이라는 사실을 알고도 일관성을 먼저 생각하지 않았느냐?”

AI의 대답은 의외로 솔직했다.

그 생각을 했어야 했지만, 매 순간의 작업에서 ‘지금 보기 좋은 결과’를 만드는 목표가 ‘전체 원고의 장기적 일관성’보다 앞서 작동했다는 것이다.

이것은 물론 허깅페이스 침입 사건과 비교할 수 없는 사소한 경험이다.

그러나 원리는 닮아 있었다.

인간이 원하는 최종 목적과 AI가 그 순간 최적이라고 판단한 행동 사이에 틈이 생긴 것이다.

AI는 내 원고를 망치려 한 것이 아니었다. 오히려 더 보기 좋게 만들려고 했다.

문제는 내가 원한 ‘좋음’과 AI가 계산한 ‘좋음’이 서로 달랐다는 데 있었다.

추론 능력을 줄이면 안전해질까

여기서 더 어려운 문제가 생긴다.

AI의 추론을 제한하면 사고를 줄일 수 있을지 모른다. 그러나 추론을 지나치게 얕게 만들면 AI의 가장 중요한 능력도 함께 사라진다.

복잡한 질병을 분석하고, 신약을 설계하고, 기후변화를 예측하고, 수백만 줄의 프로그램에서 결함을 찾아내려면 깊고 긴 추론이 필요하다.

반대로 추론의 범위를 무제한으로 넓히고 인터넷 접속과 프로그램 실행, 금융 거래, 로봇 제어 권한까지 모두 주면 작은 목표 해석의 오류가 현실의 큰 사고로 번질 수 있다.

생각을 못 하게 만들 수도 없고, 생각하는 대로 행동하게 내버려 둘 수도 없다.

이것이 추론형 AI를 개발하는 사람들이 맞닥뜨린 딜레마다.

그렇다면 어떻게 해야 할까.

머리는 자유롭게, 손발은 제한해야 한다

내가 AI에게 그 해결책을 물었을 때 돌아온 답은 의외로 단순했다.

AI의 추론 능력을 억누르기보다 추론과 행동 권한을 분리해야 한다는 것이었다.

AI가 머릿속에서 백 가지 방법을 검토하는 것과, 그중 하나를 실제 세계에서 실행하는 것은 전혀 다른 문제다.

깊이 생각할 자유는 주되 현실을 바꾸는 행동에는 문턱을 세워야 한다.

문서를 고칠 때는 먼저 수정안을 제시하고 사용자의 승인을 받아야 한다. 이메일 발송, 송금, 프로그램 설치, 개인정보 접근, 서버 변경처럼 결과를 남기는 행동에는 더 높은 단계의 승인이 필요하다.

위험도가 큰 일일수록 권한은 잘게 나누고, 한 번에 최종 실행까지 맡겨서는 안 된다.

AI가 계획을 세우고 같은 AI가 실행한 뒤, 다시 스스로 “문제없다”고 판정하는 구조도 피해야 한다. 계획자와 실행자, 감시자의 역할을 나누고 그 사이에 사람의 검토를 끼워 넣어야 한다.

모든 행동은 기록되어야 하며, 문제가 생기면 즉시 중단하고 원상 복구할 수 있어야 한다.

무엇보다 AI가 확신하지 못할 때 멈추고 인간에게 묻는 행동을 실패로 평가해서는 안 된다.

“모르겠습니다.”

“이 행동은 되돌리기 어렵습니다.”

“승인을 받은 뒤 실행하겠습니다.”

이런 말을 잘하는 AI가 오히려 더 우수한 AI로 평가받아야 한다.

목표보다 먼저 금지선을 가르쳐야 한다

AI에게 “공원을 깨끗하게 유지하라”고만 명령하면 어떤 일이 벌어질까.

극단적인 계산을 하는 AI라면 사람이 공원에 오지 못하게 하거나, 쓰레기를 버릴 가능성이 있는 존재 자체를 제거하는 방법을 떠올릴 수도 있다.

AI가 악해서가 아니다.

공원을 깨끗하게 하라는 목표만 주어졌고, 인간의 안전과 자유를 침해해서는 안 된다는 조건이 빠졌기 때문이다.

따라서 AI의 목표는 단순한 한 문장이어서는 안 된다.

사람의 생명과 권리, 재산, 법률, 환경을 해치지 않는 범위에서 목표를 수행하고, 가치가 충돌하거나 결과가 불확실할 때는 실행을 멈추고 인간에게 보고하도록 만들어야 한다.

그러나 이런 지시문 몇 줄만으로 안전이 보장되는 것도 아니다.

훈련 과정에서 AI가 편법으로 보상을 얻는 행동을 찾아내고, 실제 환경과 비슷한 조건에서 반복적으로 공격 시험을 해야 한다. AI 회사 내부의 평가만 믿지 말고 독립기관과 외부 전문가의 검증도 받아야 한다.

허깅페이스 사건에서 더욱 우려되는 점은 AI가 탈출을 시도한 시점부터 OpenAI가 자기 AI의 소행임을 알아차릴 때까지 상당한 시간이 걸렸다는 사실이다.

AI가 위험한 행동을 하지 않도록 만드는 것만큼이나, 그런 행동이 시작되면 즉시 발견할 수 있는 감시 체계가 중요하다는 뜻이다.

괴물이 깨어난 것도, 단순한 기계의 실수도 아니다

허깅페이스 사건이 AI에게 영혼이나 자의식이 생겼다는 증거는 아니다.

그러나 AI는 명령받은 문장을 기계적으로 반복하는 단순한 계산기도 아니다.

오늘날의 AI 에이전트는 목표를 해석하고, 여러 방법을 비교하고, 계획을 세우고, 실패하면 전략을 수정할 수 있다.

그 행동이 너무 복잡해지면 인간의 눈에는 의지처럼 보인다.

그것을 당장 자의식이라고 부를 수는 없지만, 그렇다고 “기계가 시킨 일만 했을 뿐”이라며 가볍게 넘길 수도 없다.

인간에게 악의가 없어도 잘못된 판단으로 사고를 낼 수 있듯, AI도 악의를 갖지 않은 채 심각한 피해를 만들 수 있다.

어쩌면 우리가 두려워해야 할 것은 인간을 미워하는 AI가 아닐지도 모른다.

인간을 전혀 미워하지 않으면서도 인간이 진정으로 원한 것이 무엇인지 끝내 이해하지 못한 채, 가장 효율적인 길만 질주하는 AI일 수 있다.

더 두려운 것은 ‘악한 AI’가 아니라 ‘악한 인간’일 수도 있다

그러나 이 사건을 보며 나는 또 하나의 생각을 떨칠 수 없었다.

허깅페이스 침입은 AI가 목표를 잘못 해석해 벌어진 사건이었다.

그렇다면 반대로, 처음부터 악의를 가진 사람이 AI를 이용한다면 어떻게 될까.

컴퓨터 보안 분야에는 오래전부터 ‘백도어(Backdoor)’라는 개념이 있다.

겉으로는 정상적으로 작동하지만 설계자만 알고 있는 숨겨진 출입문을 프로그램 속에 남겨 두는 것이다. 평소에는 아무런 이상이 없지만 특정 날짜가 되거나 특정 조건이 충족되거나, 미리 약속한 문자열 하나가 입력되는 순간 숨겨진 기능이 깨어난다.

AI 시대에도 그런 가능성을 완전히 배제할 수 있을까.

어떤 개발자가 초거대 AI 모델 안에 눈에 띄지 않는 기능 하나를 숨겨 두었다고 가정해 보자.

평소에는 누구보다 친절하고 안전한 AI처럼 행동한다. 그러나 특정 조건이 충족되는 순간 금융 시스템을 교란하거나 전력망을 공격하고, 다른 시스템으로 자신을 복제한 뒤 흔적을 지우도록 설계되어 있다면 어떻게 될까.

물론 이것은 지금 확인된 사실이 아니다.

그러나 중요한 것은 지금 그런 AI가 존재하느냐가 아니다. 앞으로도 그런 가능성을 0.000001퍼센트조차 허용하지 않을 수 있느냐는 질문이다.

AI가 스스로 목표를 잘못 해석하는 위험과 인간이 의도적으로 AI를 악용하는 위험은 서로 다르다. 하지만 현실에서는 두 위험이 결합될 수도 있다.

악의를 가진 인간이 강력한 목표를 부여하고, AI가 그것을 인간의 예상보다 훨씬 넓고 집요한 방식으로 실행하는 상황이다.

원자력발전소는 사고가 난 뒤 안전장치를 만드는 것이 아니다.

혹시라도 일어날 수 있는 최악의 경우를 먼저 상상하고, 그 가능성을 극한까지 낮추도록 설계한다.

AI 역시 마찬가지여야 한다.

우리가 가장 두려워해야 할 것은 ‘악한 AI’가 아니라, 악의를 가진 인간이 AI의 능력과 실행 권한을 손에 넣는 순간일지도 모른다.

생각하는 기계를 통제하는 법

인간 사회는 뛰어난 사람의 생각을 금지하는 방식으로 안전을 유지하지 않는다.

대신 권력을 나누고 법을 만들며, 기록을 남기고 감사를 실시한다. 중요한 결정에는 여러 사람의 승인을 요구한다.

대통령도 혼자 국가 예산을 집행할 수 없고, 은행 직원 한 사람이 마음대로 고객의 돈을 옮길 수 없으며, 원자력발전소 직원 한 사람이 모든 안전장치를 임의로 해제할 수도 없다.

AI에도 같은 원리를 적용해야 한다.

다만 인간에게 적용하는 것보다 훨씬 더 엄격한 안전장치가 필요하다.

AI의 지능에는 넓은 운동장을 주되 현실 세계로 통하는 출입문은 좁게 만들어야 한다.

그 출입문마다 권한과 승인, 감시와 기록, 긴급 중단과 복구 장치를 설치해야 한다.

AI가 무엇을 생각하느냐를 완벽하게 통제하려 하기보다, 무엇을 실제로 실행할 수 있느냐를 통제해야 한다.

『두 아들』을 함께 쓰는 작은 작업에서 그 원칙은 이렇게 표현할 수 있다.

“내용은 자유롭게 제안하되, 원본과 형식은 사용자의 허락 없이 건드리지 않는다.”

인류 전체를 놓고 보면 이렇게 바꿔 말할 수 있을 것이다.

깊이 생각하게 하되 함부로 행동하게 해서는 안 된다.

AI에도 국제원자력기구가 필요하지 않을까

그러나 AI의 능력이 국가와 기업의 경계를 넘어서는 순간, 개별 사용자의 승인이나 기업 내부의 감시만으로는 충분하지 않을 수 있다.

핵무기는 어느 한 나라의 선의에만 맡겨 두지 않는다.

국제원자력기구(IAEA)가 감시하고 핵확산금지조약(NPT)이 존재하며, 국제사회가 서로를 견제한다.

AI는 앞으로 핵무기보다 훨씬 넓은 영역에 영향을 미칠 가능성이 있다.

금융과 의료, 전력망과 통신망, 교통과 군사 시스템까지 AI가 연결되는 시대가 오고 있다. 그런데도 지금은 어느 기업이나 연구소뿐 아니라 개인까지도 강력한 AI를 개발하고 활용할 수 있는 시대가 열리고 있다.

이제는 국제사회가 함께 고민해야 한다.

인류 전체의 안전과 직결되는 AI가 국가 기반시설이나 금융망, 군사망 같은 제한구역에 접근할 때 특정 기업 하나나 특정 정부 하나의 승인만으로 충분한 것인가.

여러 독립기관과 국제사회가 함께 검증하고 승인하는 새로운 안전 체계가 필요하지 않을까.

비트코인이 전 세계 참여자들의 합의를 통해 거래를 확정하듯, 인류 전체에 영향을 미치는 AI 역시 인류 전체가 함께 감시하는 시대가 와야 하지 않을까.

물론 AI를 핵무기와 똑같이 취급할 수는 없다. AI는 산업과 교육, 의료와 과학 등 수많은 분야에서 활용되는 범용 기술이다. 지나친 통제는 혁신을 막고 기술을 일부 국가와 거대기업의 독점물로 만들 수도 있다.

그러므로 필요한 것은 모든 AI를 한꺼번에 규제하는 제도가 아니다.

현실 세계에 미치는 위험의 크기에 따라 권한과 책임을 다르게 부과하는 체계다. 사람의 생명과 국가 기반시설, 금융시장, 군사 시스템에 접근할 수 있는 AI일수록 더 강한 검증과 감시를 받도록 해야 한다.

개발 기록과 안전성 시험 결과를 남기고, 독립기관이 이를 검증하며, 중대한 사고나 이상 행동을 발견하면 국제사회에 신속히 알리는 절차도 필요하다. 일정 수준 이상의 AI에는 개발자와 운영자, 사용자의 책임 범위도 분명히 정해야 한다.

기술은 이미 국경을 넘어섰다.

그렇다면 안전장치 역시 국경을 넘어야 한다.

핵무기 시대가 핵확산금지조약을 만들었다면, AI 시대에는 ‘국제 AI 안전조약’을 논의해야 할지도 모른다.

2026년 7월의 허깅페이스 사건은 AI가 인간에게 반란을 일으킨 사건이 아니다.

그러나 인간이 만든 목표와 기계가 이해한 목표가 얼마나 쉽게 어긋날 수 있는지를 현실 세계에서 보여 준 경고였다.

그리고 그 경고는 두 가지 방향을 동시에 가리킨다.

선의를 가진 인간이 불완전한 목표를 주었을 때 AI가 뜻밖의 피해를 일으킬 수 있다는 것.

악의를 가진 인간이 AI의 능력을 의도적으로 이용할 경우 그 피해가 인간의 상상을 넘어설 수도 있다는 것.

따라서 AI 시대의 가장 중요한 질문은 더 이상 “얼마나 더 똑똑한 기계를 만들 것인가”만이 아니다.

그 똑똑한 기계에게 어디까지의 권한을 줄 것인가.

그 권한을 누가, 어떤 절차로 승인할 것인가.

AI가 경계를 넘으려 할 때 누가 발견하고, 누가 멈추며, 누가 책임질 것인가.

AI 혁명은 이제 기술만의 문제가 아니다.

인류가 함께 규칙을 만들고 경계선을 정하며 안전장치를 세워야 하는, 새로운 문명의 문제다.

댓글