딥시크 V4-플래시 2026: MI300X 한 장에 올리려면 INT4뿐 — 성능·가격·VRAM 계산
2026년 7월 31일 자로 딥시크가 ‘V4-플래시-0731’ API를 내놨습니다. AI타임스는 2026년 8월 1일 보도에서 이 모델의 “에이전트 성능 향상”을 출시 포인트로 짚었고, 사흘 뒤인 8월 4일에는 아이뉴스24가 “1회 테스트 비용 43원, 글로벌 AI 중 가장 낮다”고 전했습니다. 같은 날 뉴스비전e는 딥시크 V4 플래시의 사용량이 세계 1위에 올랐다고 보도했습니다.
개발자 입장에서 진짜 궁금한 건 벤치마크 표가 아니라 이겁니다. “이 모델, 내 서버에서 GPU 몇 장으로 돌아가나?” 이 글은 V4-플래시를 둘러싼 보도 팩트를 정리하고, 오픈소스 가중치를 자체 인프라에 올릴 때 자주 언급되는 AMD Instinct MI300X 단일 GPU 구동 가능성을 스펙 기준으로 계산해 봅니다.
1. 딥시크 V4-플래시, 지금까지 확인된 사실만
개별 벤치마크 점수는 아직 공개되지 않았습니다. 지금 확인 가능한 건 이 정도입니다.
| 항목 | 내용 | 출처 매체(보도일) |
|---|---|---|
| API 명칭 | 딥시크-V4-플래시-0731 | AI타임스 (2026-08-01) |
| 출시 강조점 | 에이전트 성능 향상 | AI타임스 (2026-08-01) |
| 1회 테스트 비용 | 43원, 글로벌 AI 중 최저 | 아이뉴스24 (2026-08-04) |
| 사용량 | 세계 1위 | 뉴스비전e (2026-08-04) |
| 에이전트 하네스 | “105분의 1 가격” | 지디넷코리아 (2026-08-04) |
| 기반 모델 V4 | 프로 1.6조(활성 490억) / 플래시 2,840억(활성 130억) | 4월 프리뷰 공개 |
눈여겨볼 점은 순위의 성격입니다. 사용량 1위는 품질 평가가 아니라 호출량 집계입니다. 디지털투데이가 전한 오픈라우터 주간 집계(6월 15일 종료 주)에서는 상위 5개 모델 중 미국 기업이 앤트로픽 한 곳뿐이었고, V4-플래시가 4조 6,300억 토큰으로 1위였습니다. 즉 이 1위는 모델이 제일 좋아서가 아니라 제일 싸서 만들어진 숫자입니다.
성능 쪽 지표가 아예 없는 건 아닙니다. AI타임스는 출시 보도에서 에이전트 코딩 벤치마크인 딥SWE 점수가 7.4점에서 54.4점으로 뛰었다고 전했습니다. 다만 SWE-bench 같은 표준 벤치마크의 공식 수치는 아직 공개되지 않았으므로, 정확한 비교는 딥시크 공식 공지를 기다려야 합니다.
6월 예고와 실제 출시가 다른 점
2026년 6월 30일 연합뉴스TV는 딥시크가 V4 정식판 출시에 맞춰 베이징 기준 업무시간대 API 요금을 두 배로 올리는 피크요금제를 도입한다고 보도했습니다. 반면 8월 초 보도들은 최저 비용을 강조합니다.
두 보도는 사실 충돌하지 않습니다. “가장 싸다”는 비교 단가 이야기이고, 피크 요금제는 같은 모델을 언제 호출하느냐의 이야기입니다. 다만 실제 청구서는 트래픽이 몰리는 시간대에 얼마나 호출하느냐에 따라 달라지므로, 단가표만 보고 예산을 잡으면 어긋납니다. 딥시크 공식 가격 페이지에서 적용 시간대를 직접 확인하세요.
2. 왜 “단일 GPU 구동”이 화두가 됐나
대형 MoE 계열 모델을 자체 호스팅할 때 첫 번째 벽은 연산량이 아니라 메모리입니다. 가중치가 GPU 한 장의 VRAM에 안 들어가면 텐서 병렬(TP)로 여러 장에 쪼개야 하고, 그 순간 GPU 간 통신이 지연의 지배 요인이 됩니다. 반대로 한 장에 올라가면 그 통신 자체가 사라져 배포·운영 난이도가 급격히 내려갑니다.
AMD Instinct MI300X가 이 논의에 계속 등장하는 이유가 여기 있습니다. AMD 공식 제품 페이지 기준 MI300X는 HBM3 192GB, 메모리 대역폭 5.3TB/s, 메모리 인터페이스 8192-bit를 제공합니다. 같은 세대 경쟁 가속기 대비 메모리 용량이 2.4배, 대역폭이 1.6배 높다는 것이 출시 당시 AMD가 내세운 수치입니다.
위 수치는 AMD 공식 제품 페이지에 실린 비교값으로, FP8(희소성 적용)에서는 H100 SXM5 3957.8 TFLOPs 대 MI300X 5229.8 TFLOPs, TF32(희소성)에서는 989.6 대 1307.4 TFLOPs입니다.
MI300X 핵심 스펙 정리
| 항목 | 값 |
|---|---|
| 아키텍처 | AMD CDNA 3 |
| 공정 | TSMC 5nm / 6nm FinFET |
| 트랜지스터 | 1530억 개 |
| 컴퓨트 유닛 | 304개 (스트림 프로세서 19,456) |
| 전용 메모리 | HBM3 192GB |
| 메모리 대역폭 | 5.3TB/s |
| LLC | 256MB |
| FP16 피크 | 1.3 PFLOPs |
| FP8 피크 | 2.61 PFLOPs |
| 보드 전력(TBP) | 750W |
| 폼팩터 / 버스 | OAM 모듈 / PCIe 5.0 x16 |
| 출시일 | 2023년 12월 6일 |
3. 192GB 한 장에 뭐가 들어가는가 — 계산해 보기
여기서부터는 모델 가중치 크기와 양자화 정밀도만으로 하는 순수 산술입니다. V4 계열의 파라미터 구성은 4월 프리뷰 공개 때 알려져 있습니다. V4-프로는 총 1.6조(활성 약 490억), V4-플래시는 총 2,840억(활성 약 130억) 규모입니다. 플래시가 “경량 변종”으로 불리는 이유가 여기 있습니다.
계산식은 단순합니다.
필요 VRAM(GB) ≈ 파라미터 수(B) × 정밀도 바이트 + KV 캐시 + 런타임 오버헤드
FP16 = 2 bytes/param
FP8 = 1 byte/param
INT4 = 0.5 byte/param
MI300X의 192GB에서 KV 캐시와 활성값용으로 넉넉히 30~40GB를 남긴다고 보면, 가중치에 쓸 수 있는 실질 예산은 약 150~160GB입니다.
여기서 MoE 구조가 중요해집니다. MoE는 추론 시 일부 전문가만 활성화되지만, 가중치는 전부 메모리에 상주해야 합니다. 활성 파라미터가 130억이라고 해서 13B 모델처럼 13GB만 있으면 되는 게 아닙니다. 기준은 총 2,840억입니다.
그럼 답이 나옵니다.
| 정밀도 | V4-플래시 284B 가중치 | MI300X 192GB 1장 |
|---|---|---|
| FP16 | 약 568GB | ❌ 불가 |
| FP8 | 약 284GB | ❌ 불가 |
| INT4 | 약 142GB | ✅ 가능 (실질 예산 150~160GB 안) |
즉 “MI300X 한 장에 V4-플래시”는 INT4까지 눌렀을 때만 성립합니다. FP8만 돼도 284GB라 192GB를 훌쩍 넘습니다. 참고로 같은 계산을 V4-프로(1.6조)에 적용하면 INT4로도 800GB라 한 장은 애초에 논외입니다.
INT4가 공짜는 아닙니다. 양자화 품질 손실과 커널 지원 여부를 실측해야 하고, KV 캐시는 컨텍스트 길이에 비례해 따로 늘어납니다. 긴 컨텍스트를 쓸수록 위 표의 여유분(30~40GB)이 빠르게 잠식되므로, “들어간다”와 “쓸 만하다”는 다른 문제입니다.
그래도 FP8을 먼저 보는 이유
MI300X는 FP8(E5M2, E4M3)에서 피크 2.61 PFLOPs를 냅니다. FP16의 1.3 PFLOPs 대비 정확히 2배입니다. 메모리를 절반으로 줄이면서 연산 처리량은 2배가 되니, 한 장에 들어가는 크기의 모델이라면 FP8이 우선 후보입니다.
다만 V4-플래시는 FP8로도 284GB라 이 조합에서 벗어납니다. 이 모델을 MI300X 한 장에 올리겠다면 선택지는 INT4뿐이고, 그때는 연산 처리량보다 양자화 품질과 커널 성숙도가 판단 기준이 됩니다. 반대로 GPU를 두 장 쓸 수 있다면 FP8(284GB)이 384GB 안에 들어가므로, 품질을 지키면서 FP8의 처리량 이점을 챙기는 쪽이 낫습니다.
4. 배포 전 확인할 5가지 — ROCm과 물리 조건
AMD GPU에서의 LLM 추론은 ROCm 위에서 돌아갑니다. MI300X 출시 당시 AMD가 함께 공개한 ROCm 6는 FP16·BF16·FP8(희소성 포함) 포맷을 지원하고, 최적화된 추론 라이브러리로 vLLM 최대 2.6배, HIP Graph 런타임으로 1.4배, 최적화 커널로 Flash Attention 1.3배 속도 향상을 제시했습니다.
실제 배포 전에 확인할 항목:
1. ROCm 버전 확인 — 모델 런타임(vLLM 등)이 요구하는 ROCm 최소 버전과 드라이버 호환 여부
2. 폼팩터 확인 — MI300X는 OAM 모듈입니다. 일반 PCIe 슬롯에 꽂는 카드가 아니라 UBB 베이스보드가 필요합니다
3. 전력 설계 — TBP 750W, 외부 전원 커넥터는 54V UBB 규격
4. 냉각 — 패시브 OAM이므로 섀시 차원의 강제 공랭/수랭 설계가 전제입니다
5. 양자화 커널 검증 — INT4/FP8 커널이 해당 모델 아키텍처에서 실제 동작하는지 소규모로 먼저 확인
2번부터 4번은 “GPU 한 장 사서 워크스테이션에 꽂는다”는 시나리오가 성립하지 않는다는 뜻입니다. MI300X 단일 GPU 구동은 서버 랙 안에서의 이야기지, 책상 위 이야기가 아닙니다.
5. 그래서 자체 호스팅이 답인가
아이뉴스24가 2026년 8월 4일 보도한 “1회 테스트 43원”과 지디넷코리아가 같은 날 보도한 에이전트 하네스 “105분의 1 가격”을 그대로 받아들이면, 냉정한 결론은 이렇습니다.
| 판단 기준 | API 사용 | 자체 호스팅 |
|---|---|---|
| 초기 비용 | 없음 | GPU + 서버 + 냉각 |
| 단가 | 보도 기준 최저 수준 | 하드웨어 감가 + 전력(750W/장) |
| 데이터 주권 | 외부 전송 | 내부 유지 |
| 운영 부담 | 낮음 | ROCm 스택 직접 관리 |
| 적합 상황 | 대부분의 개발·프로토타입 | 규제·기밀 데이터, 초대량 상시 트래픽 |
토큰 단가가 이 정도로 내려간 상황에서 순수 비용만 놓고 자체 호스팅을 정당화하기는 어렵습니다. 자체 호스팅의 근거는 데이터가 밖으로 나갈 수 없다는 규제·보안 요건이거나, API 레이턴시·가용성이 서비스 SLA를 못 맞추는 경우입니다.
중국발 저가 모델 공세는 딥시크만의 이야기가 아닙니다. 디지털투데이는 「중국 AI 모델, 토큰 사용량서 미국 추월…딥시크V4 1위」에서 상위 5개 중 미국 기업이 앤트로픽 한 곳뿐이었다고 짚었고, 알리바바도 큐원 3.8-맥스를 내놓으며 같은 축에서 경쟁하고 있습니다. 관련해서 알리바바 Qwen 3.8-Max, 2.4조 파라미터 멀티모달 프리뷰 — Kimi K3 이틀 만의 맞대응과 공짜로 GPT급 코딩 AI? 중국 Kimi K3의 실체 — 2.8조 파라미터 오픈소스를 함께 보면, 지금 저가 공세를 밀고 있는 게 딥시크 한 곳이 아니라는 게 보입니다.
6. 정리
– V4-플래시-0731은 2026년 7월 31일 API로 등장했고, 에이전트 성능 향상이 출시 포인트입니다
– 보도 기준 1회 테스트 43원으로 최저 단가, 사용량 세계 1위입니다
– MI300X는 HBM3 192GB·5.3TB/s. V4-플래시는 총 2,840억 파라미터라 INT4로 양자화해야 한 장(약 142GB)에 들어갑니다. FP8(284GB)·FP16(568GB)은 불가
– MI300X는 OAM 모듈·750W·패시브 냉각이라 UBB 베이스보드가 있는 서버 섀시가 전제입니다
– 현 단가에서는 규제·보안 요건이 없는 한 API 사용이 합리적입니다
V4-플래시의 43원은 지금 기준이고, 피크요금제가 적용되면 시간대에 따라 두 배가 됩니다. 도입 계산을 할 땐 단가표가 아니라 우리 서비스의 호출 시간대 분포를 먼저 보세요.
참고 자료
– AMD Instinct™ MI300X Accelerators
– AMD launches Instinct MI300X: new AI accelerator with 192GB of HBM3 at 5.3TB/sec bandwidth
– AMD Launches Instinct MI300X AI GPU Accelerator, Up To 60% Faster Than NVIDIA H100
– AMD Instinct MI300X GPU and MI300A APUs Launched for AI Era
– [[AI는 지금] \”105분의 1 가격\”…딥시크, 하네스로 AI 에이전트 판 흔든다 (지디넷코리아, 2026-08-04)](https://zdnet.co.kr/view/?no=20260804090446)
– 중국 AI, 글로벌 무대 ‘올킬’…딥시크 V4 플래시 사용량 세계 1위 (뉴스비전e, 2026-08-04)
– 중국 AI 모델, 토큰 사용량서 미국 추월…딥시크V4 1위 (디지털투데이)
– 딥시크, 새로운 플래그십 오픈소스 AI 모델 V4 공개 (Investing.com)
– 中 딥시크 V4 공개…1M 컨텍스트 창 ‘역효율 혁명’ (넷제로뉴스)
– 딥시크 ‘V4-플래시’, 1회 테스트 비용 43원⋯글로벌 AI 중 가장 낮아 (아이뉴스24, 2026-08-04)
– 딥시크 V4 내달 정식 출시…업무시간 요금 두 배 부과 (연합뉴스TV, 2026-06-30)
자주 묻는 질문
딥시크 V4-플래시를 MI300X 한 장으로 돌릴 수 있나요?
INT4로 양자화하면 가능합니다. V4-플래시는 총 2,840억 파라미터(활성 약 130억)이므로 INT4 기준 가중치가 약 142GB로, MI300X의 HBM3 192GB 안에 들어갑니다. 다만 FP8은 약 284GB, FP16은 약 568GB라 한 장으로는 불가능합니다. MoE는 활성 파라미터가 작아도 전체 가중치가 메모리에 상주해야 하므로 기준은 총 파라미터입니다. KV 캐시가 컨텍스트 길이에 비례해 추가로 필요하다는 점도 감안하세요.
딥시크 V4-플래시 API 요금이 시간대별로 다른가요?
피크 요금제가 예고돼 있습니다. 2026년 6월 30일 연합뉴스TV는 딥시크가 V4 정식판 출시에 맞춰 베이징 기준 업무시간대 API 요금을 두 배로 올리는 피크요금제를 도입한다고 보도했습니다. 한편 2026년 8월 4일 아이뉴스24는 로이터를 인용해 V4-플래시의 1회 테스트 비용이 43원으로 글로벌 최저라고 전했습니다. 두 보도는 상충하지 않지만, 실제 청구액은 사용 시간대에 따라 달라지므로 딥시크 공식 가격 페이지를 확인해야 합니다.
MI300X를 개인 워크스테이션에 설치할 수 있나요?
사실상 어렵습니다. MI300X는 OAM 모듈 폼팩터라 UBB 베이스보드가 필요하고, 54V UBB 외부 전원과 750W TBP를 감당해야 합니다. 냉각도 패시브 OAM이라 섀시 차원의 강제 공랭 설계가 전제됩니다. 단일 GPU 구동은 서버 랙 안에서의 이야기지 책상 위 이야기가 아닙니다.