AI 기술 심층 분석 & 미래 전망

AMD MI350 AI 가속기 총정리: MI350X·MI355X·MI350P 차이와 실무 활용

데이터항해자 2026. 7. 29. 18:17
반응형

 

AI 모델이 커질수록 GPU의 계산 성능뿐 아니라 메모리 용량과 대역폭이 중요해집니다. AMD Instinct MI350 시리즈는 대규모 AI 학습·추론과 고성능 컴퓨팅을 겨냥한 데이터센터용 가속기입니다.

MI350 시리즈에는 대규모 서버 플랫폼용 MI350X·MI355X와 기존 PCIe 서버에 적용하는 MI350P가 포함됩니다. 일반 소비자용 그래픽카드가 아니라 기업 데이터센터와 AI 클라우드를 위한 제품이라는 점부터 구분해야 합니다.

AMD MI350 AI 가속기란?

MI350X는 4세대 AMD CDNA 아키텍처를 기반으로 256개의 컴퓨트 유닛과 288GB HBM3E 메모리를 제공합니다. 최대 메모리 대역폭은 8TB/s이며 MXFP4·MXFP6 이론상 피크 성능은 최대 9.2 PFLOPS입니다. 8개의 MI350X를 탑재한 플랫폼은 총 2.3TB의 HBM3E 메모리를 제공합니다.

MI355X도 같은 CDNA 4 계열이지만 고전력·액체냉각 서버 환경을 중심으로 설계됐습니다. 따라서 MI350X와 MI355X를 하나의 동일한 사양표로 묶기보다는 서버의 냉각방식과 전력 설계를 함께 확인해야 합니다.

기존 서버를 활용하는 MI350P

2026년 5월 공개된 MI350P는 PCIe Gen 5 x16 방식의 풀하이트·풀렝스 듀얼 슬롯 카드입니다. 128개의 컴퓨트 유닛, 144GB HBM3E, 최대 4TB/s 메모리 대역폭과 최대 600W 보드 전력을 제공합니다. MXFP4·MXFP6 이론상 피크 성능은 최대 4.6 PFLOPS입니다.

MI350P의 핵심은 기존 공랭식 PCIe 서버에 장착할 수 있다는 점입니다. AMD가 소개한 대표 구성은 최대 8개 카드지만 실제 장착 수는 서버 제조사의 전력, 냉각, 슬롯 설계에 따라 달라집니다.

실무에서는 어디에 활용할까?

첫째, 기업 내부 문서를 검색해 답변하는 RAG 시스템에 활용할 수 있습니다. 여러 사용자의 질문을 동시에 처리하거나 대형 언어모델을 사내 서버에서 운영할 때 큰 HBM 용량이 도움이 됩니다.

둘째, 금융·의료·제조업처럼 데이터 통제와 보안이 중요한 조직의 온프레미스 AI 추론에 사용할 수 있습니다. MI350P는 기존 데이터센터 인프라를 활용하는 엔터프라이즈 AI 배치를 주요 용도로 제시하고 있습니다.

셋째, MI350X·MI355X 플랫폼은 대규모 모델 학습, 과학 시뮬레이션, 기후·신약·공학 계산 같은 HPC 작업에 적용할 수 있습니다.

AMD는 MI355X 기반 MLPerf Inference 6.0 제출 결과를 공개하며 ROCm 소프트웨어를 활용한 대규모 LLM 추론 성능을 제시했습니다. 다만 MLPerf 수치는 특정 모델과 시스템 구성에서 측정된 결과이므로 모든 업무에서 같은 성능을 보장하는 것은 아닙니다.

ROCm과 Kubernetes 지원

AMD GPU를 실제 서비스에 배포하려면 하드웨어뿐 아니라 ROCm과 운영도구의 지원이 중요합니다. MI350P는 AMD GPU Operator 1.5.1부터 Kubernetes와 Red Hat OpenShift 지원대상에 포함됐습니다.

공식 조건은 ROCm 7.13 이상, AMDGPU 드라이버 6.19 이상입니다. 지원 범위는 Kubernetes 1.29~1.36과 OpenShift 4.21~4.22이며, 자동 노드 복구 기능에는 아직 제한이 있습니다. 현재 공식 문서에 표시되는 최신 페이지 버전과 실제 설치환경의 호환성은 배포 전에 다시 확인해야 합니다.

MI350 시리즈의 장점

가장 큰 장점은 대용량 HBM3E입니다. MI350X의 288GB 메모리는 큰 모델이나 긴 컨텍스트를 처리할 때 모델 분할 부담을 줄이는 데 유리합니다.

FP4·FP6 같은 저정밀 연산 지원도 AI 추론 효율을 높일 수 있습니다. 또한 ROCm을 중심으로 PyTorch, Kubernetes, OpenShift와 연결할 수 있어 오픈소스 기반 AI 인프라 선택지를 넓힙니다.

Rackspace는 MI355X와 MI350P 등을 포함한 초기 30MW 규모의 AMD 기반 AI 클라우드 인프라를 2026년 말부터 2028년까지 단계적으로 구축할 계획입니다.

한계와 확인사항

MI350X는 최대 1,000W급 전력과 전용 플랫폼이 필요하므로 일반 서버에 단순히 추가하기 어렵습니다. MI350P 역시 최대 600W를 사용하기 때문에 전원공급장치, 서버 내부 공기흐름과 랙 전력밀도를 점검해야 합니다.

또한 AI 개발 생태계는 여전히 CUDA 중심인 경우가 많습니다. 기존 코드와 라이브러리를 ROCm 환경에서 검증하고, 사용하는 모델·연산자가 정상 지원되는지 확인해야 합니다.

공식 사양의 PFLOPS는 이론상 최대치이며 실제 처리량은 모델, 정밀도, 배치 크기, 네트워크와 소프트웨어 최적화에 따라 달라집니다. 현재 공개된 자료 기준으로 MI350 시리즈별 판매량, 시장점유율과 개별 매출은 공개되지 않았습니다.

미국 수출관리규정도 확인해야 합니다. MI350이라는 제품명이 모든 BIS 지침에 직접 지정된 것은 아니며 실제 허가 여부는 ECCN, 수출국, 최종사용자와 최종용도에 따라 판단됩니다.

결론

AMD MI350은 하나의 GPU가 아니라 서로 다른 데이터센터 환경을 겨냥한 제품군입니다. 대규모 AI·HPC 플랫폼에는 MI350X·MI355X, 기존 PCIe 서버를 활용한 기업 AI 추론에는 MI350P가 주요 선택지입니다.

도입을 검토할 때는 피크 성능만 비교하지 말고 실제 모델 호환성, ROCm 지원, 메모리 요구량, 전력·냉각 비용과 서버 제조사의 검증 여부를 함께 확인해야 합니다.

이 글은 AI 도구를 활용해 초안을 작성하고, 작성자가 직접 검토·수정·보완하였습니다.

핵심 요약

  • MI350X: 256 CU, 288GB HBM3E, 최대 8TB/s, 대규모 AI·HPC 플랫폼용
  • MI350P: 128 CU, 144GB HBM3E, 최대 4TB/s, 기존 PCIe 서버 적용형
  • 공통 특징: CDNA 4, MXFP4·MXFP6, ROCm 기반 AI 학습·추론 지원
  • 실무 활용: 사내 LLM, RAG, AI 추론 서비스, 과학·공학 HPC
  • 확인사항: 전력·냉각, ROCm 호환성, 서버 인증, 수출통제
  • 미공개 정보: 제품별 판매량, 개별 매출, 시장점유율

 

반응형