ddr5

2 개의 포스트

aws4분 읽기큐레이션 요약

이제 사용 가능: 새로운 AWS Graviton5 프로세서로 구동되는 Amazon EC2 M9g 및 M9gd 인스턴스 | Amazon Web Services

AWS가 자체 설계한 Graviton5 프로세서 기반 EC2 M9g와 M9gd 인스턴스를 정식 출시했다. Graviton4 대비 최대 25% 높은 컴퓨팅 성능, 더 큰 캐시와 높은 메모리·네트워크·스토리지 대역폭을 제공하며, M9gd는 최대 11.4TB의 로컬 NVMe SSD를 추가한다. 특히 에이전트형 AI, 데이터베이스, 웹 애플리케이션처럼 CPU와 I/O를 동시에 많이 사용하는 워크로드의 성능과 에너지 효율 향상을 목표로 한다. ## Graviton5의 성능 및 설계 개선 - Graviton5는 AWS의 다섯 번째 자체 설계 Arm 프로세서다. - 최대 192개의 코어를 제공하며, 이전 세대보다 L3 캐시가 5배 커졌다. - 코어 간 지연 시간은 최대 33% 감소해 병렬 처리와 다수의 동시 작업에 유리하다. - DDR5-8800 메모리와 PCIe Gen6를 지원해 AWS 인스턴스 중 가장 빠른 메모리 성능을 제공한다. - Graviton4 대비 성능 향상 폭은 다음과 같다. - 전체 컴퓨팅 성능: 최대 25% - 웹 애플리케이션: 최대 35% - 머신러닝 추론: 최대 35% - 데이터베이스: 최대 30% - 성능 향상과 함께 에너지 효율도 개선해 비용 및 지속 가능성 목표 달성에 도움을 준다. ## 에이전트형 AI와 CPU 수요 대응 - AI가 단순 질의응답을 넘어 코드 실행, 도구 호출, 결과 평가, 다단계 작업 조율을 수행하면서 CPU 처리량의 중요성이 커지고 있다. - Graviton5는 다음 특성으로 에이전트형 AI에 적합하다. - 높은 코어 수로 다수의 실행 환경을 동시에 처리 - 대형 L3 캐시로 CPU 대기 시간 감소 - 높은 메모리 대역폭으로 데이터 처리량 향상 - 가속기가 CPU 작업을 기다리는 시간을 단축 - Meta는 실시간 추론, 코드 생성, 다단계 작업 조율을 위해 수천만 개 규모의 Graviton 코어를 배포할 계획이라고 밝혔다. - Honeycomb은 6개월간의 실제 운영 A/B 테스트에서 Graviton4 대비 코어당 처리량이 36% 향상됐다고 보고했다. ## M9g와 M9gd의 차이 ### M9g: 범용 컴퓨팅 중심 - vCPU 1개당 4GiB 메모리를 제공한다. - 다음과 같은 범용 워크로드에 적합하다. - 애플리케이션 서버와 마이크로서비스 - 중간 규모 데이터 저장소 - 게임 서버와 캐시 클러스터 - 컨테이너 애플리케이션 - 대규모 Java 애플리케이션 - 코드 저장소와 웹 애플리케이션 - 에이전트형 AI ### M9gd: 로컬 NVMe 스토리지 추가 - 최대 11.4TB의 로컬 NVMe SSD를 제공한다. - Graviton4 기반 M8gd보다 IOPS 및 스토리지 성능이 30% 향상됐다. - 낮은 지연 시간의 임시 또는 로컬 스토리지가 필요한 작업에 적합하다. - 캐시와 스크래치 파일 - 데이터 로깅 - 미디어 처리 - 배치 및 로그 처리 - 키-값 데이터 저장소 - 게임 서버와 마이크로서비스 - 컴퓨팅, 메모리, 네트워크, EBS 대역폭 사양은 동일한 크기의 M9g와 같다. ## 네트워크와 스토리지 대역폭 개선 - M9g와 M9gd는 이전 세대 대비 평균적으로 다음 대역폭을 제공한다. - 네트워크 대역폭: 최대 15% 증가 - EBS 대역폭: 최대 20% 증가 - 가장 큰 인스턴스 크기: 네트워크 대역폭 최대 2배 - Instance Bandwidth Configuration(IBC)을 지원한다. - EBS와 VPC 네트워크 사이의 대역폭 할당을 최대 25% 조정할 수 있다. - 데이터베이스 읽기·쓰기, 쿼리 처리, 로깅처럼 특정 I/O 비중이 큰 워크로드에 유용하다. - 컴퓨팅 성능 증가에 맞춰 데이터 이동과 저장장치 처리량도 함께 확장한 것이 특징이다. ## Nitro Isolation Engine을 통한 보안 강화 - M9g와 M9gd는 6세대 AWS Nitro System을 기반으로 한다. - 새롭게 도입된 Nitro Isolation Engine은 가상 머신 간 격리를 담당한다. - 메모리, CPU 레지스터 상태, I/O 장치 접근을 최소한의 API를 통해 제어한다. - 정형 검증(formal verification)을 사용해 특정 테스트 사례가 아니라 수학적으로 격리 동작을 검증한다. - AWS는 이를 통해 Nitro를 공식적으로 검증된 클라우드 하이퍼바이저로 발전시키고, 가상 머신 간 보안 격리에 대한 신뢰성을 높였다고 설명한다. ## 실제 고객 성과 - ClickHouse: 코드 변경 없이 M8g 대비 성능 36% 향상 - Honeycomb: Graviton4 대비 코어당 처리량 36% 향상 - HubSpot: MySQL 쿼리 수행 시간이 최대 60% 감소 - 이러한 사례는 데이터베이스, 분석, 관측성 등 다양한 운영 환경에서의 효과를 보여준다. ## 출시 지역과 구매 방식 - 현재 제공 지역: - 미국 동부 버지니아 - 미국 동부 오하이오 - 미국 서부 오리건 - 유럽 프랑크푸르트 - 구매 방식: - Savings Plans - On-Demand - Spot Instances - Dedicated Instances - Dedicated Hosts 기존 Arm 호환 애플리케이션이라면 M9g부터 성능을 검증하고, 로컬 SSD가 필요하면 M9gd를 선택하는 것이 적절하다. x86 기반 Java 애플리케이션은 AWS Transform을 활용해 호환성 분석, 재컴파일, 의존성 수정, 검증 과정을 자동화할 수 있으며, 도입 전에는 Graviton Savings Dashboard로 비용 절감 효과를 비교하는 것이 좋다.

원문 읽기(새 탭에서 열림)
cloudflare원문

Gen 13 내부: 역대 가장 강력한 서버를 구축한 방법 (새 탭에서 열림)

Cloudflare는 Rust 기반의 새로운 요청 처리 계층인 FL2로의 전환에 맞춰, 하드웨어 성능과 효율성을 극대화한 'Gen 13' 서버를 설계했습니다. Gen 13은 192코어의 AMD EPYC Turin 프로세서와 향상된 메모리/네트워크 대역폭을 통해 이전 세대 대비 최대 2배의 처리량을 제공하면서도 전력 효율은 50% 개선했습니다. 결과적으로 하드웨어와 소프트웨어의 최적화된 결합을 통해 글로벌 네트워크 전반의 운영 비용을 절감하고 서비스 확장성을 확보하게 되었습니다. **소프트웨어 변화에 최적화된 CPU 선택** * **FL2와 L3 캐시 의존도 감소:** 이전 세대(Gen 12)는 대용량 L3 캐시가 특징인 Genoa-X를 사용했으나, Rust로 재작성된 FL2 스택은 L3 캐시 의존도가 낮아진 대신 코어 수에 따라 성능이 선형적으로 확장되는 특성을 보입니다. * **AMD EPYC 9965(Turin) 채택:** 코어당 캐시 용량은 줄었으나, 코어 수를 192개(Gen 12 대비 2배)로 늘려 총 처리량(Requests per second)을 극대화했습니다. * **전력 및 운영 효율성:** 500W TDP 설정에서 최적의 와트당 성능을 구현하며, 서버 한 대당 처리 능력을 높여 관리해야 할 노드 수를 줄임으로써 운영 복잡성을 낮췄습니다. * **미래 지향적 설계:** DDR5-6400, PCIe 5.0, CXL 2.0을 지원하며 AMD의 최신 아키텍처를 통해 더 긴 보안 지원 주기와 시스템 수명을 보장받습니다. **메모리 대역폭 및 용량의 극대화** * **12채널 구성:** AMD Turin 프로세서의 성능을 뒷받침하기 위해 12개의 메모리 채널을 모두 사용하는 '1 DIMM per channel(1DPC)' 구성을 채택했습니다. * **대역폭 33% 향상:** DDR5-6400 ECC RDIMM을 사용하여 초당 614GB의 최대 메모리 대역폭을 확보했으며, 이는 메모리 집약적인 병렬 작업 시 병목 현상을 방지합니다. * **용량 최적화:** 코어 수가 늘어남에 따라 전체 메모리 용량을 768GB로 증설하여, Cloudflare가 최적으로 판단하는 '코어당 4GB'의 메모리 비율을 유지했습니다. * **메모리 인터리빙:** 동일한 용량과 규격의 메모리를 12개 채널에 균등하게 배치하여 데이터 액세스 속도를 높이는 인터리빙 기술을 적용했습니다. **네트워크 및 스토리지 가속화** * **4배 더 빠른 네트워크:** 기존 25GbE에서 듀얼 100GbE NIC(네트워크 인터페이스 카드)로 전환하여 폭발적인 데이터 유입에도 지연 시간(SLA) 내에 처리가 가능하도록 설계했습니다. * **PCIe 5.0 기반 스토리지:** 24TB의 PCIe 5.0 NVMe 스토리지를 탑재하여 데이터 입출력 속도를 개선하고 용량을 1.5배 늘렸습니다. * **보안 강화:** 메모리 암호화뿐만 아니라 PCIe 암호화 하드웨어 지원을 추가하여 데이터 이동 시 보안성을 강화했습니다. Gen 13 서버는 단순한 사양 업그레이드를 넘어, 소프트웨어 아키텍처(Rust FL2)의 변화가 하드웨어 설계의 방향을 어떻게 바꿀 수 있는지 보여주는 사례입니다. 고밀도 컴퓨팅이 필요한 환경이라면 대용량 캐시에 의존하기보다, 최신 아키텍처 기반의 다코어 CPU와 이를 뒷받침할 수 있는 충분한 메모리 대역폭 및 네트워크 속도를 확보하는 것이 성능과 비용 효율성 측면에서 유리할 것입니다.