데이터 주권은 흔히 '준법'이라는 칸에 갇힙니다. 감사를 통과하려 한 번 체크하고 마는 항목으로 말입니다. 그러나 사실 이것은 AI에 관한 결정입니다: 오늘 여러분이 붙들어 두는 데이터가 곧 내일 여러분의 AI가 배울 수 있는 데이터이고, 한번 내준 데이터는 거의 되찾을 수 없습니다. 이 글에서는 진짜 주권과 '국내에 놓인 서버'를 구분하고, 왜 그것이 나만의 AI를 위한 필요조건인지 설명하며, 그것을 진정으로 갖기 위해 여러분이 능동적으로 해야 할 일이 무엇인지를, 주권은 계약에 저절로 딸려 오지 않으므로, 짚어 보겠습니다.
주권은 단지 '서버가 어디 있느냐'가 아닙니다
많은 사람이 데이터 주권을 지리적 질문으로 환원합니다: 서버가 국내에 있는가. 그것은 일부일 뿐입니다. 진짜 주권은 여러분이 세 가지를 결정하고 그 셋을 모두 입증할 수 있다는 뜻입니다: 데이터가 어디에 있는지, 누가 그것을 읽을 수 있는지, 그리고 어떤 모델(여러분의 것이든 제삼자의 것이든)이 그것을 건드릴 수 있는지. 어느 시스템은 서버가 국내에 있어도 처리를 위해 외부 API로 데이터를 보낼 수 있습니다. 그러면 지리는 맞지만 주권은 이미 잃은 것입니다. Apus에서는 운영 데이터가 기본적으로 공급업체의 멀티테넌트 클라우드가 아니라 여러분의 인프라 위에 있으며, 읽고 쓰고 처리하는 결정은 여러분의 것입니다.
진짜 주권을 점검하는 세 가지 질문
- 내일 공급업체와의 계약을 끝낸다면, 여러분은 전체 데이터를 쓸 수 있는 형태로 가지고 나올 수 있습니까. 아니면 흩어진 내보내기 파일 하나만 가능합니까?
- 어떤 데이터가 여러분의 경계를 벗어나 어느 서비스로 가는지 정확히 알고, 그것을 막을 수 있습니까?
- AI 모델이 여러분의 데이터를 처리할 때, 그것이 어디서 돌아가는지 통제할 수 있고, 그 데이터가 다른 사람을 위한 학습에 쓰이지 않는다는 것을 보장할 수 있습니까?
이 셋 모두에 확실하게 답할 수 없다면, 여러분이 가진 것은 사용권이지 주권이 아닙니다.
왜 주권이 나만의 AI를 위한 선결 조건인가
이미 남에게 넘겨 버린 데이터 위에 기업 특화 AI를 세울 수는 없습니다. 전체 운영 이력(주문, 생산, 품질, 고객 관계)이 여러분의 것이고 여러분의 인프라 위에 있을 때, 그것은 여러분 자신의 기업을 아는 모델을 위한 학습 저장소가 됩니다. 그것이 바로 경쟁자도 빌릴 수 있는 범용 지능을 임차하는 것과, 오직 여러분만의 운영 방식에 대한 지능을 소유하는 것의 차이입니다. 다섯 공급업체에 잘게 나뉜 데이터는 그런 저장소로 다시 모으기가 거의 불가능합니다. 각자가 한 조각씩 붙들고 있고, 어느 조각도 모델이 전체 그림을 이해하기에 충분하지 않기 때문입니다.
데이터를 내줄 때마다 미래의 문 하나가 닫힙니다
사소해 보이는 결정 하나를 그려 봅시다: 편리하다는 이유로 외부 분석 서비스를 쓰며 지난 3년치 판매 데이터를 그곳에 밀어 넣는 것. 오늘 여러분은 예쁜 보고서 하나를 얻습니다. 하지만 그 3년치 데이터는 이제 여러분의 경계 밖에 있고, 나중에 나만의 예측 모델을 학습시키려 할 때 여러분은 자신의 가장 좋은 데이터 집합이 이미 남의 집에 가 있음을, 혹은 경쟁자도 사는 제품을 개선하는 데 쓰였음을 발견합니다. 데이터를 밖으로 보내는 통합 하나하나가 미래의 선택지 하나를 조용히 닫는 것이며, 그 대가는 되찾기엔 너무 늦었을 때에야 드러납니다.
보안과 역량은 맞바꿔야 하는 것이 아닙니다
흔한 걱정은 이렇습니다: 데이터를 집에 두면 외부의 강력한 AI 모델을 쓸 권리를 잃는다. 하이브리드 아키텍처가 민감도에 따른 라우팅으로 이를 풀어 줍니다: 민감한 데이터를 건드리는 작업은 여러분의 경계 안에서 내부 모델로 처리되고, 일반 작업(초안 작성, 공개 문서 요약)은 여전히 외부 대형 모델을 쓸 수 있습니다. 여러분은 보안과 힘 사이에서 고르지 않습니다. 무엇이 어디로 갈지 결정하는 정책을 세우고, 그 정책을 언제든 바꿀 권리를 쥡니다.
함정: 주권은 관리되어야 하며 저절로 오지 않습니다
위험한 오해 하나는 온프레미스를 택하거나 소스 코드를 인수하면 끝이라고, 데이터가 집에 있으니 당연히 주권이 있다고 생각하는 것입니다. 꼭 그렇지 않습니다. 주권은 유지해야 하는 자세입니다: 누구에게 무엇을 읽을 권한을 주는지, 어떤 통합을 켜는지, 어떤 데이터를 어떤 작업을 위해 밖으로 보내도 되는지. 그것들을 관리하지 않으면, 서버가 여러분 자신의 전산실에 있어도 수십 개의 편리한 통합을 통해 데이터가 서서히 새어 나갈 수 있습니다. 주권은 매일 반복되는 결정이지, 한 번 체크하는 항목이 아닙니다.
미래의 선택지를 지키는 가장 확실한 방법은 내주지 않는 것에서 시작하는 것입니다. 데이터를 집에 두는 것은 오늘 거의 비용이 들지 않으면서, 여러분이 내일 필요로 할 가장 값진 것을 보전합니다: 기업이 실제로 어떻게 운영되는지에 대한, 완전하고 관리된 데이터 집합. 이미 내준 데이터 위에서는 AI를 학습시킬 수 없습니다. 그리고 그것이 데이터 주권이 단지 준법에 관한 결정이 아니라 AI에 관한 결정인 이유입니다.
“이미 내준 데이터로는 AI를 학습시킬 수 없습니다.”