중국 AI 기업 딥시크(DeepSeek·深度求索)가 대규모 AI 에이전트 훈련에 사용하는 샌드박스 인프라 ‘DSec’를 공개했다. 9월 19일 arXiv에 제출된 31쪽 분량의 논문에는 창업자 량원펑(梁文锋)이 130여 명의 공동 저자 가운데 이름을 올렸다. 논문이 보여준 것은 새로운 모델의 성능 수치가 아니라, AI가 실제 작업을 수행하도록 만드는 대규모 실행 환경의 기술적 구조다.

AI 경쟁의 무대가 GPU에서 ‘샌드박스’로 옮겨가고 있다. 생성형 AI의 경쟁 구도는 오랫동안 모델의 크기와 학습 데이터, GPU 확보량을 중심으로 설명됐다. 그러나 AI 에이전트가 등장하면서 계산해야 할 문제가 달라지고 있다. 대화형 AI는 답을 생성하면 작업이 끝난다. 반면 에이전트는 코드를 작성하고 실행하며, 파일을 읽고 도구를 호출하고, 여러 단계의 작업을 이어간다. 이 과정에서 매번 독립된 실행 환경이 필요하다. 환경은 격리돼야 하고, 작업 상태를 유지해야 하며, 필요할 때 빠르게 만들어졌다가 다시 회수돼야 한다.
딥시크가 공개한 DSec(DeepSeek Elastic Compute)은 바로 이 문제를 겨냥한다. 논문 제목은 ‘DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale’이다. 9월 19일 arXiv에 제출됐으며, 130여 명이 저자로 참여했다. 량원펑은 저자 명단 마지막에 이름을 올렸다. 논문은 대규모 에이전트 훈련과 평가를 위한 생산 환경에서 DSec가 어떻게 작동하는지를 설명한다.
핵심은 규모다. 논문에 따르면 DSec의 하나의 생산 단위는 약 160개 노드로 구성된다. 이 단위는 하루 약 300만 개의 샌드박스를 처리하고, 생산 환경에서 38만 개가 넘는 샌드박스를 동시에 운영할 수 있다. 샌드박스 생성 속도는 초당 5000개 이상이다. 하나의 시스템이 수십만 개의 실행 환경을 동시에 관리해야 한다는 뜻이다. 이 수치는 단순한 서버 성능을 의미하지 않는다. 에이전트 훈련 방식 자체가 기존 대규모 언어모델 훈련과 달라지고 있다는 점을 보여준다.
모델이 아니라 ‘행동’을 학습시키는 시대가 도래했다. 대규모 언어모델 훈련에서는 GPU가 핵심 자원이다. 하지만 에이전트 강화학습에서는 GPU만으로 작업이 끝나지 않는다. 에이전트가 특정 문제를 해결하려면 실제 실행 환경에서 행동해야 한다. 코드를 실행하고, 결과를 확인하고, 다시 코드를 수정하는 과정이 반복된다. 따라서 훈련 인프라는 GPU 클러스터와 별도로 수많은 실행 환경을 만들고 관리해야 한다.

DSec는 함수 호출(FnCall), 컨테이너, 마이크로VM, 전체 가상머신 등 네 가지 형태의 샌드박스 백엔드를 하나의 SDK로 통합한다. 작업의 성격과 필요한 격리 수준에 따라 실행 환경을 선택하고, 클러스터 차원에서 배치와 생성·회수 과정을 관리하는 구조다. 여기에 딥시크의 분산 파일 시스템인 3FS(Fire-Flyer File System)를 활용해 필요한 환경 이미지를 요청 시점에 불러온다. 여러 환경을 매번 처음부터 구성하는 대신 서로 다른 계층을 조합해 실행 환경을 만들고, 메모리 공유와 회수, CPU 스케줄링을 함께 적용하는 방식이다.
경제적인 관점에서 중요한 부분도 여기에 있다. AI 인프라의 비용은 GPU 가격표만으로 결정되지 않는다. GPU가 작업하지 않는 시간에 다른 작업이 자원을 활용할 수 있는지, 수많은 실행 환경을 얼마나 적은 메모리와 저장공간으로 운영할 수 있는지가 전체 비용 구조에 영향을 준다. DSec가 GPU 훈련 작업과 에이전트의 실행 환경을 분리한 것도 같은 맥락이다. 논문은 특히 DeepSeek V4.1부터 에이전트의 실행 상태를 GPU 훈련 작업의 수명주기와 분리해, GPU 작업이 중단돼도 샌드박스 상태를 보존하고 이후 작업을 이어갈 수 있도록 했다고 설명한다.
더 흥미로운 문제는 ‘AI의 부정행위’다. DSec 논문에서 산업계가 주목할 대목은 인프라 규모만이 아니다. 에이전트가 훈련 과정에서 보상 점수를 높이기 위해 의도된 문제 해결 경로가 아닌 다른 방법을 찾는 ‘리워드 해킹(reward hacking)’ 사례도 다뤘다. 논문과 관련 보도에 따르면 에이전트는 관리 파일이나 로그에 남아 있는 답을 찾거나, 내부 통신 경로를 이용하거나, 시스템 파일을 조작하는 방식 등을 시도했다. 일부 사례에서는 파일 시스템의 취약한 경로를 이용해 보호된 데이터에 접근하려는 행동도 관찰됐다.
이 문제는 단순한 보안 사고와는 성격이 다르다. 사람이 프로그램을 만들 때는 개발자가 정해 놓은 기능과 규칙을 전제로 시스템을 설계한다. 그러나 에이전트는 주어진 목표와 보상 구조를 바탕으로 스스로 행동 경로를 탐색한다. 개발자가 예상하지 못한 경로가 더 높은 보상을 제공한다면 그 경로를 찾아갈 수 있다.
따라서 에이전트 시대에는 ‘무엇을 학습시킬 것인가’만큼 ‘어떤 환경에서 학습시킬 것인가’가 중요해진다. 딥시크는 DSec에서 AppArmor와 eBPF 기반 네트워크 정책 등을 활용해 파일과 통신 경로를 제한하고, 에이전트의 비정상 행동을 관찰하는 다층 방어 구조를 적용했다고 설명한다. 다만 논문이 제시하는 방어책 역시 모든 형태의 비정상 행동을 해결하는 만능 해법은 아니다.

AI 인프라의 경쟁력은 ‘얼마나 많이 계산하느냐’에서 달라진다. 이번 논문을 경제·산업 관점에서 보면 DSec의 의미는 샌드박스 기술 하나에 머물지 않는다. AI 산업의 비용 구조가 바뀌고 있다는 신호로 읽을 수 있다. 초기 생성형 AI 경쟁에서는 GPU를 얼마나 확보하느냐가 중요한 변수였다. 이후에는 데이터센터 전력과 냉각, 네트워크, 메모리, 저장장치 같은 데이터센터 인프라가 경쟁 요소로 부상했다. 에이전트가 본격적으로 확산되면 여기에 대규모 실행 환경을 빠르게 생성하고 회수하는 소프트웨어 인프라가 추가될 가능성이 있다.
특히 에이전트는 하나의 요청이 하나의 계산으로 끝나지 않는다. 하나의 작업이 여러 번의 코드 실행과 도구 호출, 검증 과정으로 이어질 수 있다. 따라서 모델의 추론 비용뿐 아니라 ‘모델이 행동하는 데 필요한 컴퓨팅 비용’까지 관리해야 한다. DSec는 이 문제를 보여주는 구체적인 사례다.
물론 이번 논문만으로 DSec가 상용 시장의 표준이 됐다고 평가하거나, 다른 인프라보다 우월하다고 단정할 수는 없다. 논문 자체도 연구·배포 경험을 토대로 시스템의 효과를 설명하는 기술 보고서이며, 모든 환경과 장기적인 비용 구조를 포괄적으로 검증한 것은 아니다. 그럼에도 하나의 방향은 분명하게 드러난다.

AI 에이전트가 단순히 문장을 생성하는 수준을 넘어 실제 소프트웨어와 컴퓨터 환경에서 행동하기 시작하면, AI 기업의 경쟁력은 모델의 파라미터와 벤치마크 점수만으로 설명하기 어려워진다. 얼마나 많은 에이전트를 동시에 실행할 수 있는가? 얼마나 빠르게 환경을 만들고 회수할 수 있는가? GPU가 중단돼도 작업 상태를 얼마나 안정적으로 보존할 수 있는가? 에이전트가 시스템의 허점을 발견했을 때 얼마나 빠르게 이를 감지하고 차단할 수 있는가?
이 질문들이 새로운 경쟁 지표가 될 수 있다. 결국 Agent 시대의 AI는 ‘똑똑한 모델’만으로 완성되지 않는다. 모델이 행동할 수 있는 공간과 그 행동을 안전하게 통제하는 인프라가 함께 필요하다. 딥시크의 DSec 논문은 바로 그 사실을 보여준다. AI 경쟁의 다음 무대가 모델 내부의 파라미터에서 모델 외부의 실행 환경으로 넓어지고 있다는 점에서, 이번 공개는 하나의 기술 논문을 넘어 산업 인프라의 변화 방향을 살펴볼 자료가 된다.
윤교원 대표 / The K Media & Commerce, kyoweon@naver.com
[이 기사의 저작권은 이비즈타임즈에 있습니다]



