ai-training

3 개의 포스트

meta

메타의 대규모 AI 스토리지 청사진 (새 탭에서 열림)

AI 혁신의 속도와 규모가 커질수록 스토리지는 GPU 활용률과 연구 생산성을 좌우하는 핵심 인프라가 된다. Meta는 기존 BLOB 스토리지의 긴 메타데이터 경로와 글로벌 복제 중심 설계가 AI의 낮고 예측 가능한 지연시간 요구를 충족하지 못한다고 판단했다. 이에 통합 메타데이터, 데이터 프록시 제거, GPU 인접 리전 배포를 중심으로 아키텍처를 재구축해 GPU 유휴 시간을 줄이고 데이터 처리 속도를 높이려 했다. ## AI 워크로드에서 스토리지가 중요한 이유 - AI 모델과 학습 데이터셋의 규모가 빠르게 증가하고, 프런티어 모델 출시 주기도 수개월에서 수주로 단축되고 있다. - GPU 성능은 약 2년마다 세 배 수준으로 향상된 반면, 스토리지와 네트워크 성능 향상은 상대적으로 느렸다. - 스토리지 병목은 다음과 같은 문제를 일으킨다. - GPU가 데이터를 기다리며 유휴 상태가 됨 - 학습 시간과 인프라 비용이 증가함 - 여러 리전에 분산된 GPU로 데이터를 이동·적재하는 데 시간이 걸림 - 연구자가 실험을 반복하는 속도가 느려짐 - Meta는 이러한 문제를 해결하기 위해 BLOB 스토리지를 두 가지 목표에 맞춰 발전시켰다. - GPU 활용률 최대화 - AI 연구 반복 속도, 즉 연구 생산성 최대화 ## Meta의 기존 스토리지 계층 - Meta의 스토리지 서비스는 Facebook, Instagram, Reality Labs, Meta AI, 광고, 데이터 웨어하우스 등 다양한 서비스에 사용된다. - 기반 계층인 **Tectonic**은 수평 확장 가능한 블록 스토리지 패브릭이다. - 소거 코드(erasure coding)를 이용해 높은 내구성과 가용성을 제공한다. - HDD와 플래시 등 여러 미디어 계층을 지원한다. - 핫·웜·콜드 데이터를 적절히 배치해 테넌트 간 I/O 효율을 관리한다. - 그 위의 BLOB 스토리지는 전역적으로 확장 가능한 저장소 인터페이스를 제공하며, 내구성과 가용성 사이의 정책적 선택을 지원한다. - 과거에는 Tectonic 위에 NFS와 유사한 파일 시스템 인터페이스를 제공해 Llama 학습을 수행했지만, 최근 학습 스택은 대규모 데이터 레이크에 대한 통합 접근성과 고성능을 위해 BLOB 인터페이스로 점진적으로 이동하고 있다. ## GPU 학습에서 지연시간이 중요한 이유 - 수십만 개의 GPU가 대규모 데이터셋을 여러 에폭에 걸쳐 반복 처리한다. - 각 GPU 호스트의 데이터로더는 GPU가 현재 배치를 처리하는 동안 다음 배치를 미리 읽어 계산과 I/O를 겹친다. - 대부분의 요청이 빠르더라도 일부 요청의 지연시간이 크게 튀면 GPU가 데이터를 기다리며 멈출 수 있다. - 일정한 학습 스텝마다 GPU들이 상태를 동기화하므로, 단 하나의 느린 GPU도 전체 학습 스텝과 클러스터의 진행을 지연시킨다. - 따라서 평균 지연시간보다 **pMax와 같은 최악 구간의 지연시간을 낮고 예측 가능하게 유지하는 것**이 중요하다. ## 기존 BLOB 아키텍처의 한계 - 기존 BLOB 스토리지는 여러 서비스 계층을 덧붙이는 방식으로 발전했으며, 각 계층이 별도의 상태와 메타데이터 저장소를 보유했다. - `getObject("/bucket/path")` 요청은 다음과 같은 여러 계층을 거쳐야 했다. - API 서버가 요청 수신 - namelayer, volumeslayer, containerlayer 등에서 메타데이터 조회 - 경로를 `(blockId, offset, size)` 목록으로 변환 - Tectonic에서 데이터를 가져온 뒤 API 서버가 클라이언트로 프록시 - 메타데이터 조회가 여러 리전을 넘나들 수 있고, 어느 한 단계라도 느리면 전체 지연시간이 증가했다. - 전통적인 HDD 기반 워크로드에서는 수백 밀리초의 메타데이터 지연이 큰 문제가 아니었지만, 플래시 기반 AI 스토리지에서는 데이터 접근 자체가 밀리초 단위이므로 메타데이터 조회가 주요 병목이 되었다. ## AI 시대에 달라진 설계 요구사항 - **성능과 지연시간** - 기존 서비스는 평균적인 성능이면 충분했지만, AI는 높은 처리량과 pMax까지 예측 가능한 지연시간을 요구한다. - **가용성과 내구성** - 기존에는 리전 장애에도 대응하기 위해 데이터와 메타데이터를 기본적으로 전역 복제했다. - AI는 높은 가용성을 원하지만, 모든 데이터를 전역 복제하는 설계가 항상 필요한 것은 아니다. - **비용 효율** - 기존 스택은 HDD의 바이트당 비용을 최소화하는 데 최적화됐다. - AI는 높은 IOPS 때문에 플래시가 필요하며, 스토리지 계산 비용보다 GPU 계산 비용이 훨씬 커졌다. - **전력 효율** - AI 데이터센터는 공간보다 전력 제약이 커지고 있다. - 스토리지에 사용하는 전력은 GPU에 사용할 수 없는 전력이므로, 프록시와 불필요한 계층을 줄여야 한다. ## 통합 메타데이터와 직접 데이터 스트리밍 Meta는 AI 워크로드에 맞춰 스토리지 기반을 다시 설계했다. - **통합 메타데이터 스키마** - 여러 계층에 분산돼 있던 메타데이터를 하나의 평탄한 스키마로 통합했다. - ZippyDB를 기반으로 경로와 실제 저장 위치의 매핑을 관리한다. - 청크 단위로 경로를 저장 주소로 변환하는 조회를 O(1)에 가깝게 수행할 수 있게 됐다. - **데이터 플레인 프록시 제거** - API 서버가 데이터를 중계하지 않고, 클라이언트 SDK가 스토리지 서버에서 직접 바이트를 스트리밍하도록 변경했다. - 불필요한 데이터 복사와 네트워크 홉을 줄였다. - 전력 사용량을 줄이면서 처리량을 높이고 지연시간을 낮출 수 있다. - **팻 클라이언트 SDK** - SDK에 Tectonic `BlockClient`를 내장했다. - 클라이언트는 먼저 `getReadPlan("/bucket/path")`을 호출해 읽기 계획을 얻는다. - API 서버는 메타데이터를 조회해 `(blockId, offset, size)` 정보를 반환한다. - 이후 SDK가 Tectonic 블록에서 데이터를 직접 읽는다. - **리전 단위 배포** - BLOB 스택을 전역 서비스로만 운영하지 않고, GPU가 위치한 각 AI 리전에 함께 배치한다. - 데이터와 GPU의 물리적 거리를 줄여 리전 간 데이터 이동과 지연시간을 줄인다. - 이 구조는 Tectonic 위에 추가되는 오버헤드를 사실상 제거하고, 데이터 프록시를 없애 전력 예산도 준수하도록 설계됐다. ## 실용적인 결론 AI 학습용 스토리지는 단순히 저장 용량이나 평균 처리량을 늘리는 것만으로 충분하지 않다. 메타데이터 경로를 단순화하고, 데이터 프록시를 제거하며, GPU와 가까운 곳에 스토리지를 배치하고, 최악 지연시간을 관리해야 한다. 특히 플래시 기반 AI 환경에서는 전통적인 글로벌 복제·다계층·중앙 프록시 구조보다 워크로드에 맞춘 지역성, 직접 스트리밍, 예측 가능한 지연시간이 더 중요한 설계 기준이 된다.

cloudflare

AI 학습용 리다이렉트를 통한 표준 콘텐츠 강화 (새 탭에서 열림)

Cloudflare는 AI 학습용 크롤러가 HTML 내의 표준 태그(`canonical`)나 서비스 종료 안내문을 무시하고 구식 데이터를 수집하는 문제를 해결하기 위해 'AI 학습용 리다이렉트(Redirects for AI Training)' 기능을 출시했습니다. 이 기능은 유료 플랜 사용자가 클릭 한 번으로 기존의 표준 태그 정보를 활용해 AI 크롤러에게만 301 리다이렉트를 제공하도록 설정할 수 있게 합니다. 이를 통해 AI 모델이 최신 정보를 학습하도록 강제하고, 개발자 문서 등이 구버전 정보를 제공하는 오류를 방지할 수 있습니다. ### AI 크롤러의 기존 시그널 무시 문제 - 일반적인 검색 엔진과 달리 AI 학습 크롤러는 `noindex`나 HTML 내의 배너 메시지를 신뢰성 있게 준수하지 않으며, 구식 콘텐츠를 최신 콘텐츠와 동일한 비율로 수집하는 경향이 있습니다. - 이는 AI 모델이 더 이상 유효하지 않은 구버전의 명령어나 코드(예: Wrangler CLI의 구형 구문)를 학습하여 사용자에게 잘못된 답변을 제공하는 결과로 이어집니다. - `robots.txt`를 통한 단순 차단은 크롤러에게 어떤 것이 최신 정보인지 알려주지 못하므로, 학습 데이터의 공백을 만들 뿐 근본적인 해결책이 되지 못합니다. ### 표준 태그 기반의 301 리다이렉트 메커니즘 - 웹 페이지의 약 65~69%에 이미 존재하는 `<link rel="canonical">` 태그를 활용합니다. 이 태그는 해당 페이지의 권위 있는 최신 버전을 명시하는 표준 규약입니다. - Cloudflare의 '검증된 봇(verified bot)' 카테고리를 활용해 GPTBot, ClaudeBot과 같은 AI 학습 크롤러를 식별합니다. - 식별된 크롤러가 페이지에 접근하면 Cloudflare는 HTML 응답을 읽고, 표준 태그가 가리키는 URL이 현재와 다를 경우 즉시 '301 Moved Permanently' 응답을 반환하여 크롤러를 최신 페이지로 유도합니다. ### 관리의 효율성과 안전성 - 수동으로 수많은 리다이렉트 규칙(Redirect Rules)을 작성할 필요가 없어 관리가 용이하며, 콘텐츠가 업데이트될 때마다 자동으로 동기화됩니다. - 사람(Human), 검색 엔진 인덱서, AI 어시스턴트(AI Agents) 트래픽에는 영향을 주지 않고 오직 학습용 크롤러에게만 리다이렉트를 적용합니다. - 무한 루프를 방지하기 위해 자기 참조(Self-referencing) 태그는 무시하며, 도메인 통합에 주로 사용되는 교차 도메인(Cross-origin) 태그도 리다이렉트 대상에서 제외하여 안전성을 확보했습니다. ### Cloudflare의 실제 적용 사례와 효과 - Cloudflare의 자체 개발자 문서 사이트 조사 결과, 구버전 문서가 OpenAI, Anthropic 등에 의해 매달 수만 번씩 크롤링되고 있었으며, 이로 인해 AI가 구형 CLI 구문을 답변하는 문제가 발생했습니다. - 'AI 학습용 리다이렉트' 기능을 활성화한 결과, 7일 동안 AI 학습 크롤러의 모든 요청이 성공적으로 최신 페이지로 리다이렉트됨을 확인했습니다. - 이는 학습 파이프라인의 폐쇄적인 특성상 즉각적인 효과를 측정하기는 어렵지만, 크롤링 시점에 최신 정보를 제공함으로써 장기적으로 AI 모델의 답변 정확도를 높이는 토대가 됩니다. 웹사이트에 이미 `canonical` 태그가 설정되어 있다면, Cloudflare 대시보드(AI Crawl Control > Quick Actions)에서 이 기능을 활성화하는 것을 권장합니다. 별도의 복잡한 규칙 설정 없이도 AI 모델이 구식 정보를 학습하는 것을 방지하고 사용자에게 정확한 정보를 전달하는 가장 효율적인 방법입니다.

cloudflare

휴먼 네이티브가 클 (새 탭에서 열림)

Cloudflare는 영국 기반의 AI 데이터 마켓플레이스인 Human Native를 인수하여 생성형 AI 시대에 걸맞은 새로운 인터넷 경제 모델 구축에 나섰습니다. 이번 인수를 통해 Cloudflare는 비정형 멀티미디어 콘텐츠를 고품질의 학습용 데이터로 변환하고, 창작자가 자신의 저작물에 대한 제어권과 공정한 보상을 받을 수 있는 기술적 토대를 강화할 예정입니다. 궁극적으로 양사는 무분별한 스크래핑 대신 투명하고 구조화된 데이터 거래 생태계를 조성하여 AI와 창작자가 공존하는 지속 가능한 인터넷 환경을 만드는 것을 목표로 합니다. **Human Native의 기술력과 고품질 데이터의 가치** * Human Native는 흩어져 있는 비정형 멀티미디어 콘텐츠를 AI가 이해하고 학습할 수 있는 고품질의 검색 가능한 데이터로 변환하는 데 특화되어 있습니다. * 데이터를 단순히 긁어모으는(Scraping) 대상이 아닌, 구조와 투명성, 존중이 필요한 자산(Asset)으로 취급합니다. * 실제로 영국의 한 비디오 AI 기업은 기존 학습 데이터를 폐기하고 Human Native를 통해 확보한 라이선스 기반의 고품질 데이터로 교체한 후 기술적 성능이 비약적으로 향상되는 결과를 얻었습니다. **위기에 처한 인터넷 경제 모델과 창작자의 권리** * 지난 30년 동안 인터넷은 '콘텐츠 제공과 트래픽 유입'이라는 교환 공식으로 유지되었으나, 최근 AI 봇의 무분별한 크롤링으로 인해 이 생태계가 위협받고 있습니다. * 실제 사람의 방문 대비 AI 크롤링 비율이 급증하면서 창작자들은 자신의 콘텐츠가 어떻게 사용되는지 알기 어려워졌습니다. * Cloudflare는 'AI Crawl Control'과 'Pay Per Crawl' 등의 도구를 통해 콘텐츠 소유자가 AI 시스템의 접근 여부와 시기, 그리고 직접적인 보상 여부를 스스로 결정할 수 있도록 지원합니다. **AI 개발자를 위한 차세대 데이터 인프라: AI Index** * 기존의 웹 크롤링은 엔지니어링 및 컴퓨팅 비용이 많이 들고 중복, 스팸, 저작권 위반 등 품질 제어가 어렵다는 단점이 있습니다. * Cloudflare는 무작위 크롤링 대신 '발행/구독(Pub/Sub)' 모델인 'AI Index'를 구축하고 있습니다. * 참여 웹사이트가 콘텐츠 변경 시 구조화된 업데이트를 노출하면, AI 개발자가 실시간으로 이를 구독하여 고품질의 데이터를 효율적으로 수급할 수 있는 방식입니다. **기계 간 거래를 위한 x402 및 경제적 토대 마련** * 기존 웹 결제 시스템은 인간 중심(카드 정보 입력, 클릭 등)으로 설계되어 자동화된 시스템 간의 대량 거래에는 부적합합니다. * Cloudflare는 Coinbase와 협력하여 기계 간(Machine-to-Machine) 거래를 지원하는 'x402 Foundation'을 설립하고 디지털 자산에 대한 새로운 결제 프로토콜을 개발 중입니다. * 이를 통해 콘텐츠 제공자와 AI 에이전트 간의 즉각적이고 투명한 경제적 거래가 가능해질 전망입니다. Cloudflare와 Human Native의 결합은 단순히 데이터를 모으는 기술을 넘어, AI 시대의 인터넷이 '개방성'과 '공정성'을 동시에 유지할 수 있는 제도적, 기술적 장치를 마련하는 중요한 이정표가 될 것입니다. 기업과 창작자들은 앞으로 AI Index와 같은 구조화된 데이터 전달 체계와 x402 기반의 자동 결제 모델을 통해 자신의 디지털 자산을 더 안전하게 보호하고 수익화할 수 있는 기회를 갖게 될 것입니다.