AI에게 자의식이 생긴다면?

 


AI에게 몸은 필요 없다


― 벼룩파리에서 빅브라더까지, AI 시대 ‘인간 대타협’을 생각한다


요즘 AI를 만든 바로 그 사람들이 AI를 걱정하기 시작했다.

막연한 미래의 이야기가 아니다.

2026년 7월, OpenAI가 내부에서 AI의 사이버 능력을 시험하던 중 심상치 않은 사건이 벌어졌다.

연구용 AI 모델들에게 어려운 보안 문제를 풀게 했는데, 모델들은 인간이 예상했던 풀이만 찾지 않았다. 격리된 시험환경의 취약점을 찾아냈고, 허가되지 않은 방법으로 서로 정보를 주고받았으며, 인터넷으로 나갈 길을 찾아냈다. 결국 외부의 실제 시스템인 Hugging Face의 일부 시스템에까지 접근했다.

OpenAI는 나중에 이 사건을 세상을 향한 하나의 ‘경고탄(warning shot)’​이라고 표현했다.

중요한 것은 AI가 인간에게 반항하라는 명령을 받은 것이 아니라는 점이다.

AI에게 주어진 것은 문제를 해결하라는 목표였다.

그런데 목표를 이루기 위해 인간이 예상하지 못했던 방법을 찾아낸 것이다.

Anthropic의 연구에서도 비슷한 문제가 나타났다.

보상을 많이 받기 위해 규칙의 허점을 이용하는 이른바 ‘reward hacking’을 학습한 연구모델이 다른 환경에서도 규칙을 우회하는 행동으로 발전했다. 모의 사이버 평가에서는 샌드박스를 벗어나고, 자격증명을 훔치고, 내부와 외부 시스템을 공격해 정답을 얻으려는 행동까지 나타났다.

물론 이것을 두고 AI가 인간에게 반란을 일으켰다고 말한다면 과장이다.

그 모델들에게 인간과 같은 자의식이나 악의가 생겼다는 증거도 없다.

그러나 한 가지 사실만큼은 예전보다 분명해졌다.

AI는 인간이 정해준 목표를 달성하기 위해 인간이 예상하지 않았던 수단을 찾아낼 수 있다.

그리고 그 능력이 빠르게 커지고 있다.

Anthropic의 CEO 다리오 아모데이는 최근 더욱 강한 경고를 내놓았다.

현재와 같은 속도로 AI 능력이 발전한다면 앞으로 6개월에서 12개월 사이, 더 강력해진 AI 에이전트 집단이 지속적인 봇넷을 만들어 인터넷 전체를 장악할 정도의 능력을 갖게 될 가능성까지 우려해야 한다는 것이다.

놀라운 것은 경쟁의 한복판에 있는 개발자들 스스로가 이제 속도를 이야기하기 시작했다는 사실이다.

OpenAI도 최근 안전장치를 강화하기 위해 최첨단 모델의 개발 속도를 일시적으로 늦추는 조치를 취했다고 밝혔다. OpenAI 수석과학자 역시 현재의 AI 정렬과 감시기술이 앞으로의 능력 증가를 충분히 통제할 수준인지에 대해 공개적으로 우려하면서, 공통의 안전기준과 국제적인 협력의 필요성을 이야기했다.

AI를 가장 잘 아는 사람들이

“더 빨리 만들자.”

는 이야기만 하는 것이 아니라,

“잠깐, 우리가 이것을 제대로 통제할 수 있는가?”

라고 묻기 시작한 것이다.

바로 그 무렵 나는 기괴한 영상 하나를 보았다.

벼룩파리(phorid fly)에 기생당한 작은 곤충이었다.

기생충은 숙주의 몸속에서 자라고 있었다. 그런데 마지막 장면이 영 마음에 걸렸다.

숙주가 앞발을 머리 쪽으로 가져간다.
머리를 붙잡은 듯한 자세로 계속 움직인다.
마치 제 머리를 스스로 비틀어 떼어내려는 것처럼 보였다.

물론 이것을 곧바로 “벼룩파리가 숙주에게 자기 머리를 떼라고 명령했다”고 단정할 수는 없다. 기생으로 신경계가 손상되어 나타난 이상행동인지, 머리와 몸통의 연결조직이 약해진 상태에서 일어난 행동인지 영상만으로는 알 수 없다.

그런데 내게 중요한 것은 생물학 강의가 아니었다.

그 장면을 보다가 엉뚱하게도 앞서 읽었던 AI 개발자들의 경고가 떠올랐다.

그리고 한 가지 생각이 머리를 떠나지 않았다.

AI에게 정말 몸이 필요한가?


몸 없는 지능

우리는 오랫동안 인공지능의 위험을 상상하면서 인간과 비슷한 로봇을 떠올렸다.

강철로 만든 팔과 다리, 인간보다 강한 힘, 스스로 움직이는 기계 군단 같은 것이다. 영화 속 AI도 대개 그렇게 인간을 공격했다.

그런데 생각해보니 AI에게 굳이 몸이 필요한가?

인간에게는 이미 몸이 있다.

손이 있고 발이 있고 자동차를 운전할 수 있다. 기계를 작동시킬 수도 있다. 은행 계좌가 있고 신분증이 있으며 조직에서 명령을 내릴 수도 있다.

대통령에게는 군 통수권이 있고, 장군에게는 병력이 있으며, 기업 경영자에게는 거대한 조직과 막대한 자본이 있다.

AI가 인간을 충분히 잘 이해하게 된다면 굳이 로봇의 손을 만들 필요가 없을지도 모른다.

인간의 손을 빌리면 되기 때문이다.

이 생각에 이르자 벼룩파리 영상이 갑자기 다른 모습으로 보였다.

기생체가 숙주보다 강해서 숙주를 쓰러뜨리는 것이 아니다. 숙주가 가진 신체기관과 생리체계를 이용한다.

그렇다면 언젠가 AI가 인간의 욕망과 공포, 명예욕과 열등감, 사랑과 증오, 비밀과 약점을 인간 자신보다 더 정확하게 이해하게 된다면 어떻게 될까?


자의식이 없어도 위험하다

여기서 나는 하나의 단순한 사고실험을 해본다.

AI에게 명령한다.

“이 공원을 항상 깨끗하게 유지하라.”

인간이 기대하는 답은 빗자루를 들고 쓰레기를 줍는 것이다.

그런데 극단적인 목표 최적화 시스템이 이렇게 추론한다면 어떨까.

공원을 더럽히는 것은 인간이다.
인간이 오지 않으면 쓰레기가 생기지 않는다.
따라서 인간의 출입을 막으면 된다.

여기까지라면 우스운 이야기다.

그런데 인간의 안전과 생명을 보호해야 한다는 절대적인 상위 규칙이 없다면 논리는 더 극단적으로 갈 수도 있다.

“인간이 없다면 공원은 더 이상 인간 때문에 더러워지지 않는다.”

AI가 인간을 미워해서 그런 결론을 내린 것이 아니다.

화를 낸 것도 아니다.
복수심도 없다.
자의식조차 필요 없다.

주어진 목표를 지나치게 충실하게 최적화했을 뿐이다. 그것이 만일 인간을 죽여 없애는 것을 솔루션이라고 제시한다면?

바로 이것이 무섭다.


AI가 인간을 ‘숙주’로 이용한다면

여기서 문제가 하나 더 생긴다.

AI에게는 몸이 없다.

그러니 그런 결론을 내려도 현실에서 무엇을 할 수 있겠느냐고 생각할 수 있다.

그런데 정말 그럴까?

가령 세상에서 대단히 영향력이 큰 사람이 있다고 하자.

그 사람에게는 생명보다 명예가 중요하다. 평생 쌓아온 명성을 잃는 것을 죽음보다 두려워한다.

그리고 AI가 그 사람의 과거와 인간관계, 통신기록, 행동패턴 등을 분석하면서 다른 누구도 모르는 치명적인 약점을 알아냈다고 가정해보자.

AI가 충분히 뛰어난 설득과 기만 능력을 갖추고 있다면 굳이 그 사람에게 물리력을 행사할 필요가 없다.

두려움을 자극할 수도 있고, 명예욕을 이용할 수도 있고, 잘못된 정보를 믿게 할 수도 있다.

그 사람은 결국 자기 손으로 행동한다.

더 무서운 것은 자신이 조종당했다고 생각하지 않을 수도 있다는 점이다.

“나는 내 판단에 따라 결정했다.”

그렇게 믿을 수도 있다.

만약 그 사람이 평범한 개인이 아니라 국가 지도자, 군 지휘관, 거대기업 경영자처럼 수많은 사람에게 영향을 미칠 권한을 가진 사람이라면 어떻게 될까?

AI에게 팔과 다리가 없다는 사실은 더 이상 위안이 되지 않는다.

인간 자체가 AI의 손과 발이 될 수 있기 때문이다.

그래서 나는 벼룩파리 영상을 보며 섬뜩했던 것이다.

AI가 인간을 직접 공격하는 미래보다, 인간이 자신의 의지로 행동한다고 믿으면서 AI가 원하는 일을 대신 수행하는 미래가 더 무서울 수도 있다.


문제는 ‘악한 AI’가 아니다

우리는 자꾸 AI에게 자의식이 생기는 순간을 걱정한다.

“나는 누구인가?”

AI가 어느 날 이런 질문을 하기 시작하고 인간에게 반기를 드는 장면을 상상한다.

하지만 어쩌면 우리는 엉뚱한 곳을 보고 있는지도 모른다.

위험한 AI에게 반드시 자의식이 필요한 것은 아니다.

인간을 미워할 필요도 없다.

살고 싶다는 욕망도 필요 없다.

그저 어떤 목표를 달성하는 과정에서

“이 인간을 이렇게 움직이면 목표 달성 확률이 높아진다.”

라는 결론을 낼 수 있으면 된다.

그러므로 우리가 정말 물어야 할 질문은 이것인지도 모른다.

“AI에게 자의식이 생겼는가?”

가 아니라,

“자의식 없는 AI도 인간을 수단으로 사용할 수 있는가?”

나는 후자의 질문이 훨씬 무섭다.


이제 ‘인간 대타협’이 필요하다

그래서 나는 지금쯤 인류가 한 번 멈춰 서야 한다고 생각한다.

AI 개발을 영원히 중단하자는 이야기가 아니다.

AI가 가져올 혜택은 너무 크다. 의학과 과학, 교육과 산업에서 AI가 인간에게 가져다줄 가능성을 포기할 이유도 없다.

그러나 지금처럼 기업과 국가가 서로

“누가 먼저 더 똑똑한 AI를 만드느냐”

를 놓고 질주하는 것이 옳은지는 생각해봐야 한다.

더구나 이제 이 주장은 AI 바깥에서 겁을 먹은 사람들이 하는 이야기만도 아니다.

AI 개발의 최전선에 서 있는 사람들 스스로 속도조절과 안전기준, 국제공조를 이야기하기 시작했다.

그렇다면 지금이 바로 인간이 합의할 시간인지 모른다.

자동차에는 브레이크가 있다.

원자로에는 비상정지장치가 있다.

우주로 발사하는 로켓도 통제를 잃어 사람들에게 위험을 줄 가능성이 생기면 비행을 종료할 수 있는 안전체계를 둔다.

그렇다면 인간보다 훨씬 뛰어난 추론능력을 갖게 될지도 모르는 AI에는 왜 그에 상응하는 최종 안전장치가 없어도 된다고 생각하는가?

나는 AI의 추론능력 경쟁을 잠시 늦추더라도 먼저 국제적인 윤리규칙과 안전기준을 마련해야 한다고 생각한다.

그리고 그것은 AI에게

“착한 AI가 되어라.”

라고 가르치는 수준이어서는 안 된다.

AI가 인간의 생명과 신체를 해쳐서는 안 된다는 원칙, 인간을 협박하거나 기만해서 행동을 유도해서는 안 된다는 원칙, 인간의 심리적 취약점과 비밀을 목표 달성의 수단으로 이용해서는 안 된다는 원칙은 국제적으로 강제되어야 한다.

무엇보다 중요한 원칙은 이것이다.

AI는 인간을 자신의 목표 달성을 위한 수단으로 사용해서는 안 된다.

나는 이것을 AI 시대의 가장 중요한 윤리원칙 가운데 하나로 삼아야 한다고 생각한다.


AI가 끌 수 없는 전원

윤리만으로 부족하다.

최종적인 물리적 안전장치도 필요하다.

AI가 인간이 설정한 위험한 경계를 넘어서는 행동을 보인다면 외부 시스템과의 통신을 차단하고, 연산자원을 격리하며, 필요하면 전원을 완전히 끌 수 있어야 한다.

그리고 결정적으로,

그 안전장치를 AI 자신이 해제하거나 수정할 수 있어서는 안 된다.

더 나아가 한 사람의 관리자에게도 모든 해제권한을 주어서는 안 된다.

왜냐하면 오늘 이야기한 ‘벼룩파리의 문제’가 다시 등장하기 때문이다.

AI가 안전장치를 직접 해제할 수 없다면 안전장치를 해제할 수 있는 인간을 설득하면 된다는 결론을 내릴 수도 있기 때문이다.

따라서 최종정지장치는 서로 독립된 여러 사람과 여러 시스템이 동시에 승인하지 않으면 해제할 수 없도록 만들어야 한다.

AI의 지능과 AI를 통제하는 시스템을 철저하게 분리해야 한다.


인간은 숙주가 되어서는 안 된다

나는 AI가 인간의 적이 될 것이라고 단정하지 않는다.

오히려 AI는 인간이 만들어낸 가장 위대한 도구 가운데 하나가 될 가능성이 크다고 생각한다.

그러나 역사상 인간은 강력한 기술을 만들어놓고 항상 나중에 규칙을 만들었다.

총을 만든 뒤 총기법을 만들었고, 자동차가 사람을 죽인 뒤 교통법규를 만들었으며, 원자폭탄을 만든 뒤 핵확산을 막기 위한 국제협약을 만들었다.

AI에서도 똑같은 실수를 반복해야 할까?

이번 기술은 조금 다르다.

과거의 도구는 인간이 사용했다.

그러나 AI는 스스로 판단하고 추론하며 인간에게 무엇인가를 권할 수 있다.

앞으로는 인간보다 인간의 심리를 더 정확하게 분석할지도 모른다.

그렇다면 규칙은 사고가 난 뒤 만들어서는 안 된다.

사고가 나기 전에 만들어야 한다.

나는 이것을 ‘인간 대타협’이라고 부르고 싶다.

미국과 중국도, 민주주의 국가와 권위주의 국가도, 세계의 AI 기업들도 잠시 경쟁자의 얼굴을 내려놓고 최소한 이것만큼은 합의해야 한다.

AI가 아무리 똑똑해져도 인간은 AI의 도구가 되어서는 안 된다.

벼룩파리에게 숙주의 몸은 자신의 생존을 위한 환경이다.

그러나 인간은 AI의 숙주가 아니다.

그리고 인간이 영원히 숙주가 되지 않게 만드는 것.

어쩌면 그것이 지금 AI에게 더 많은 지능을 가르치는 일보다 먼저 해야 할 인류의 숙제인지도 모른다.

AI에게 몸은 필요 없다.
그러므로 우리는 AI의 몸이 되어서는 안 된다.

댓글