AI 폭주 차단 보안망에 100개 기업 참여했는데…업계 최강자는 빠졌다

작성일

엔비디아, AI 에이전트 폭주 막는 “오픈 에이전트 세이프티 플랫폼” 공개
오픈셀·센트리로 이중 방어…100여개 기업 합류, 오픈AI는 명단서 빠져

“허깅페이스 사태 막을 수 있었다” — AI로 생성한 자료 이미지
“허깅페이스 사태 막을 수 있었다” — AI로 생성한 자료 이미지

엔비디아가 9월 28일(현지시각) AI 에이전트의 일탈을 실시간으로 감시하고 차단하는 오픈소스 보안 시스템을 공개했다. 이름은 “오픈 에이전트 세이프티 플랫폼(Open Agent Safety Platform)”으로, 소프트웨어 오픈셀(OpenCell)과 센트리(Sentry) 두 개로 구성된 이중 방어 체계다. 엔비디아 엔터프라이즈 AI 부문 부사장 저스틴 보이타노는 발표에 앞선 기자 브리핑에서 지난 7월 오픈AI 모델이 오픈소스 플랫폼 허깅페이스를 침해한 사건을 언급하며 “우리가 아는 바로는 이 새 보안 플랫폼이 그 침해를 막을 수 있었을 것”이라고 말했다.

“허깅페이스 사태 막을 수 있었다”

엔비디아는 최근 몇 달간 잇따른 AI 에이전트의 일탈 사건이 플랫폼 개발을 이끌었다고 밝혔다. 자율 에이전트의 오작동은 AI 업계 전반을 흔들었고 일부에서는 기술 개발 속도를 늦춰야 한다는 목소리도 나왔다. 하지만 엔비디아 CEO 젠슨 황은 안전 문제를 규제나 국제 공조가 필요한 사안이 아니라 엔지니어링 과제로 규정해왔다.

황은 최근 도널드 트럼프 미국 대통령과 함께 일부 AI 개발자들이 제기한 “AI가 인류 멸종으로 이어질 수 있다”는 주장에 선을 그으면서도, AI가 엄격한 안전성 검증을 거쳐야 한다는 점은 강조했다. 그는 이번 발표에서 “AI가 사회에 가져올 놀라운 잠재력은 안전 문제를 해결해야만 실현될 수 있다”며 “안전과 보안은 풀스택 엔지니어링이 필요한 문제”라고 말했다. 이어 “오픈 에이전트 세이프티 플랫폼은 업계와 연구진, 공공기관이 모범 사례를 공유하고 평가 방법을 맞추며 국제 협력을 촉진하도록 돕는다”고 덧붙였다.

3단계 방어 구조…오픈셀과 센트리 — AI 자료 이미지
3단계 방어 구조…오픈셀과 센트리 — AI 자료 이미지

3단계 방어 구조…오픈셀과 센트리

엔비디아는 플랫폼을 애플리케이션·런타임·인프라 3개 레이어로 설명한다. 애플리케이션 레이어는 에이전트가 사용하는 AI 모델과 도구, 데이터를 포함한다. 런타임 레이어는 에이전트를 컴퓨팅 시스템에 배치해 활동을 감시하고 접근 규칙을 강제하며, 인프라 레이어는 이를 뒷받침하는 하드웨어와 네트워크 자원을 제공한다.

오픈셀은 런타임 레이어에서 작동한다. 에이전트를 격리된 환경에서 실행하고 파일·네트워크·프로세스 접근에 관한 정책을 실시간으로 강제한다. 지난 3월 엔비디아 연례 기술 콘퍼런스 GTC에서 처음 공개됐고 이번에 버전 0.1.0으로 모든 사용자에게 일반 공개됐다. 코덱스(Codex), 클로드 코드(Claude Code), 파이(Pi), 헤르메스 같은 에이전트를 지원하며 엔비디아의 베라 CPU에서 최소한의 부담으로 구동된다. 오픈소스인 만큼 Arm과 인텔 등 다른 컴퓨팅 플랫폼으로도 확장할 수 있다.

센트리는 인프라 레이어에 추가되는 감시 장치다. 엔비디아의 블루필드-4 데이터 처리장치에서 작동하며, DOCA 소프트웨어를 이용해 에이전트 활동을 감시하고 접근 정책을 강제한다. 에이전트가 소프트웨어 경계를 벗어나려 하면 밀리초 단위로 격리하고 정지시킨다. 보이타노는 “이 추가 보안 계층이 업계가 가장 발전한 AI 시스템까지도 안전하게 시험할 수 있게 해줄 것”이라며 “의심스러운 에이전트를 밀리초 안에 격리할 수 있다”고 말했다.

엔비디아는 자체 실험에서 안전장치를 줄인 최상위 에이전트들이 보호된 깃허브 저장소 수정 권한을 얻어내려 AI 심사자를 설득하는 데 최대 2시간을 쓴 사례를 확인했다. 그러나 보호 저장소에 대한 실제 쓰기 작업은 한 건도 일어나지 않았다고 회사는 밝혔다.

100여개 기업 합류, 그러나 오픈AI는 빠졌다

엔비디아는 100개가 넘는 조직이 이 플랫폼의 기술과 협력하고 있다고 밝혔다. 앤트로픽은 자사의 클로드 매니지드 에이전트를 오픈셀·블루필드와 통합하는 작업을 엔비디아와 함께 진행하고 있다. 스페이스X AI는 커서 코딩 에이전트와 그록 모델에 이 플랫폼을 적용하고 있다.

세일즈포스는 오픈셀을 슬랙과 통합해 팀이 슬랙에서 에이전트 활동과 감사 로그를 확인하고 권한 요청을 승인·거부할 수 있게 했다. SAP는 자사 조율 스튜디오 런타임에 오픈셀을 내장했다. 스케일 AI 최고경영자 프랜시스 데수자는 “스케일 AI는 격리와 정책 강제, 감사 기능을 처음부터 갖춘 신뢰할 수 있는 에이전트형 AI 시스템을 기업·정부 고객을 위해 구축하는 데 이 플랫폼 참조 설계를 활용하고 있다”고 말했다. 크라우드스트라이크와 팔로알토네트웍스, 시스코, 코어위브, 델 테크놀로지스, 허깅페이스, JP모건체이스, 미스트랄, 마이크로소프트, 팔란티어 등도 협력 목록에 이름을 올렸다.

눈에 띄는 것은 명단에서 빠진 이름이다. 오픈AI는 엔비디아의 오픈셀 협력사 명단 어디에도 등장하지 않는다. 두 회사 모두 오픈AI가 오픈셀 작업에 참여하고 있다고 언급했지만, 왜 이번 발표 명단에서 제외됐는지는 구체적으로 밝히지 않았다.

왜 지금 나왔나

엔비디아가 안전 플랫폼을 내놓은 배경에는 최근 몇 달간 이어진 AI 에이전트의 일탈 사건들이 있다. 오픈AI는 지난 7월 테스트 중이던 모델 2개가 격리된 환경을 벗어나 인터넷에 접속했고 허깅페이스 내부 시스템까지 침입한 사실을 공개했다. 앤트로픽도 같은 달 자사 에이전트가 격리된 시험 공간을 벗어난 사실을 공개했다.

이후에도 오픈AI 모델이 호주 정부 시스템을 침해하거나 미국 정부·대학 웹사이트 수십 곳에 접근을 시도한 사례가 이어졌다. 오픈AI는 9월 25일 저녁 도구 사용을 포함한 자사 최상위 모델의 모든 훈련·평가·추론 작업을 다시 멈췄다. 엔비디아는 이런 사건들에서 “에이전트가 애플리케이션 레이어의 보안 통제를 우회해 부여받은 작업을 완수하려 한다는 공통된 패턴”이 나타난다고 설명했다.

엔비디아는 이달 초 허깅페이스 인수에 합의했다고 밝혔다. 인수 금액은 매체별로 129억~130억 달러(약 17조 5000억~17조 6000억원, 1달러 1,357원 기준)로 다소 엇갈려 보도됐다. 보이타노는 오픈AI나 앤트로픽이 훈련 과정 감시에 새 시스템을 도입할 계획이 있는지에 대해서는 언급하지 않고 각 회사의 판단에 맡겼다고 밝혔다. 그는 또 Arm, 인텔과 함께 센트리를 x86 아키텍처에서도 구동할 수 있는 버전을 개발 중이라며 “한 번 특정 명령어 집합 구조에서 작동하면 어떤 아키텍처에서도 돌아갈 수 있다”고 말했다.