Pexels photo 17483873
|

오픈웨이트 모델 완벽 가이드 2026: 개념·라이선스 함정·로컬 실행 VRAM까지

📌 핵심 요약오픈웨이트와 오픈소스는 다릅니다. 2026년 주요 모델 8종 라이선스 비교, MAU 조항 3가지 함정, Q4 양자화 VRAM 계산법까지 한 번에 정리했습니다. 도입 전 지금 확인하세요.

“오픈소스 모델 쓰면 되죠?”라는 한마디로 시작한 프로젝트가, 법무 검토 단계에서 멈추는 일이 2026년 들어 부쩍 늘었습니다. 원인은 대부분 같습니다. 가중치가 공개된 모델을 전부 “오픈소스”라고 뭉쳐서 부르기 때문입니다. 실제로는 상업적 사용 조건, 파생 모델 재배포, 서비스 이름 표기 의무까지 라이선스마다 전혀 다릅니다.

이 글은 오픈웨이트(open-weight) 라는 용어의 정확한 범위, 2026년 7월 기준 실무에서 쓰이는 모델들의 라이선스 지도, 그리고 내 장비에서 돌아가는지 판단하는 VRAM 계산법까지를 순서대로 정리합니다.

오픈웨이트와 오픈소스는 무엇이 다른가

소프트웨어에서 오픈소스는 “소스코드를 받아 고치고 재배포할 수 있다”는 뜻입니다. 그런데 LLM에서 소스코드에 해당하는 것은 세 덩어리입니다. 학습 데이터, 학습 코드, 그리고 학습 결과인 가중치입니다. 이 중 가중치만 내려받을 수 있는 상태가 오픈웨이트입니다.

구분 가중치 공개 학습 코드·레시피 학습 데이터 대표 예
완전 오픈소스 O O O OLMo, Pythia 계열
오픈웨이트 O 일부(기술 보고서 수준) X Llama, Qwen, gpt-oss, Gemma 등 대다수
클로즈드(API) X X X GPT·Claude·Gemini 상용 API

즉 우리가 흔히 “오픈소스 LLM”이라 부르는 것 상당수는 정확히는 오픈웨이트입니다. OSI(오픈소스 이니셔티브)도 2024년 OSAID 정의를 내면서 데이터 정보 공개 없이는 오픈소스로 부를 수 없다는 입장을 명시했습니다. 용어를 구분해야 하는 실무적 이유는 하나입니다. 오픈웨이트는 라이선스가 개별 계약에 가깝기 때문에, 모델마다 읽어야 합니다.

2026년 주요 오픈웨이트 모델 라이선스 지도

실무에서 자주 검토되는 모델을 라이선스 기준으로 묶으면 이렇습니다.

모델 개발사 라이선스 핵심 제약
Qwen3-235B-A22B 알리바바 Apache 2.0 사실상 제약 없음(고지 유지)
gpt-oss-120b / 20b OpenAI Apache 2.0 사용 정책 문서 별도 동의
Mistral Small 3.x Mistral AI Apache 2.0 없음(일부 상위 모델은 연구용 별도)
DeepSeek-R1 DeepSeek MIT 증류·상업 이용 허용
Phi-4 마이크로소프트 MIT 없음
Kimi K2 Moonshot AI 수정 MIT 대규모 상용 시 제품에 모델명 표기
Llama 4 계열 Meta Llama 커뮤니티 라이선스 MAU 7억 초과 시 별도 계약, 네이밍 규칙
Gemma 3 구글 Gemma 이용약관 금지 사용 정책(별도 문서) 준수

각 행의 라이선스는 위 링크(Hugging Face 모델 카드 메타데이터 또는 리포지토리 LICENSE 원문) 기준입니다. Kimi K2는 모델 카드상 `license: other / license_name: modified-mit`으로 표기됩니다.

주요 8종 중 5종은 Apache 2.0·MIT 계열
8개합계
Apache 2.03개 (37.5%)
MIT2개 (25.0%)
수정 MIT1개 (12.5%)
커스텀 라이선스2개 (25.0%)

위 표 8종을 세어보면 완전 허용형(Apache 2.0·MIT)이 5종, 조건부가 3종입니다. 중국계 모델이 오히려 Apache 2.0·MIT를 택해 채택 장벽을 낮추는 흐름은 2025년 이후 뚜렷해졌습니다. 이 경쟁 구도의 배경은 공짜로 GPT급 코딩 AI? 중국 Kimi K3의 실체에서 더 자세히 다뤘습니다.

실무에서 걸리는 라이선스 조항 3가지

1) 사용자 규모 임계값

Llama 커뮤니티 라이선스는 직전 월 활성 사용자 7억 명을 넘는 사업자에게 별도 라이선스를 요구합니다. 스타트업에는 사실상 무관하지만, 대기업 계열 서비스에 임베드할 때는 법무 확인 대상입니다.

2) 네이밍·표기 의무

Llama 4 커뮤니티 라이선스 1(b)(i)은 두 가지를 요구합니다. 배포물·웹사이트·제품 문서에 “Built with Llama”를 눈에 띄게 표시할 것, 그리고 Llama로 학습·파인튜닝한 모델을 배포하면 모델명 맨 앞에 “Llama”를 붙일 것(“include ‘Llama’ at the beginning of any such AI model name”)입니다. 단순히 이름 어딘가에 넣으면 되는 게 아니라 접두어여야 합니다.
Kimi K2의 수정 MIT는 발동 기준이 명시돼 있습니다. 월 활성 사용자 1억 명 초과 또는 월 매출 2천만 달러 초과인 제품·서비스라면 UI에 “Kimi K2″를 눈에 띄게 표시해야 합니다. 그 아래 규모에는 적용되지 않습니다. Apache 2.0·MIT는 이런 의무가 없습니다.

3) 사용 정책 연동

Gemma 이용약관과 gpt-oss의 사용 정책은 라이선스 본문 외의 별도 문서를 참조합니다. 이 문서는 개발사가 갱신할 수 있으므로, 도입 시점의 사본을 보관해 두는 것이 안전합니다.

Apache 2.0은 사용자 규모 제한이 없다
Apache 2.0VSLlama 커뮤니티
100

상업 이용 자유도

70

100

파생·재배포 자유도

60

100

사용자 규모 제한 없음

30

100

네이밍 의무 없음

40

> 위 점수는 조항 개수와 강도를 기준으로 한 자체 평가이며, 법률 자문이 아닙니다. 계약 검토는 원문을 근거로 하세요.

내 장비에서 돌아갈까: VRAM 계산법

판단 공식은 단순합니다. 필요 메모리 ≈ (파라미터 수 × 파라미터당 비트 ÷ 8) + KV 캐시입니다. FP16은 파라미터당 2바이트, 4비트 계열은 실측 파일 크기를 역산하면 파라미터당 0.55~0.6바이트쯤 됩니다(이 범위는 아래 실측값에서 뽑은 자체 추정치입니다).

Q4 양자화하면 70B도 48GB 한 장에 들어간다
Llama 8B

5GB

Mistral 24B

14GB

Llama 70B

43GB

gpt-oss-120b

63GB

차트 값은 실제 배포 파일 크기입니다. Q4_K_M 기준으로 Llama 3.1 8B 4.92GB, Mistral Small 24B 14.33GB, Llama 3.3 70B 42.52GB이고, gpt-oss-120b는 MXFP4로 단일 80GB GPU에 올라가는 크기입니다. 여기에 컨텍스트 길이에 비례하는 KV 캐시가 더 붙습니다. KV 캐시는 레이어 수와 KV 헤드 구성(GQA)에 따라 크게 달라지므로 일반 공식은 없지만, 32K 컨텍스트라면 가중치 크기의 1.2~1.3배를 잡고 시작해 실제 로드로 확인하는 편이 안전합니다(이 배수도 경험적 어림값입니다). 긴 컨텍스트를 쓸 때의 설계 고려사항은 Claude 5 컨텍스트 엔지니어링 실전 가이드의 KV 관리 부분과 원리가 같습니다.

양자화, 어디까지 줄여야 하나

추정치 대신 실제 배포 파일로 재봤습니다. Qwen3-8B GGUF 기준 BF16 원본이 16.39GB이고, Q8_0 8.71GB(53.1%) · Q5_K_M 5.85GB(35.7%) · Q4_K_M 5.03GB(30.7%)입니다. unsloth 배포본도 같은 크기로, 등급별 비율은 모델이 달라져도 대체로 이 근처입니다.

Q4_K_M은 FP16의 31% 크기(Qwen3-8B 실측)

53%
Q8_0

36%
Q5_K_M

31%
Q4_K_M

등급 선택은 공개된 정설이 있는 영역이 아니라 워크로드마다 다릅니다. 현장에서 흔히 쓰는 출발점은 코드 생성·구조화 출력처럼 정확성이 중요한 작업에 Q5_K_M 이상, 요약·분류·챗봇에 Q4_K_M입니다. 다만 어느 등급에서 무엇이 먼저 무너지는지는 모델·태스크마다 갈리므로, 반드시 자체 평가셋으로 확인한 뒤 등급을 확정하세요. 특히 JSON 스키마 준수처럼 형식이 중요한 작업은 등급을 낮추기 전에 실패율을 직접 재보는 게 안전합니다.

MoE가 판을 바꾼 이유

2026년 오픈웨이트의 주류는 MoE(전문가 혼합)입니다. 총 파라미터는 크지만 토큰당 활성화되는 파라미터는 일부라, 메모리는 많이 쓰고 연산은 적게 쓰는 구조입니다.

MoE는 총 파라미터의 3~10%만 활성화한다
Kimi K2

3.2%

gpt-oss-120b

4.4%

DeepSeek-V3

5.5%

Qwen3-235B

9.4%

각 모델 카드가 밝힌 수치입니다. Kimi K2는 총 1T 중 활성 32B, DeepSeek-V3는 671B 중 37B, Qwen3-235B-A22B는 235B 중 22B, gpt-oss-120b는 117B 중 5.1B입니다(위 차트의 3~10%는 이 값들의 비율). 참고로 DeepSeek-V3의 Hugging Face 총 용량은 685B로 표시되는데, 모델 카드가 밝히듯 본체 671B에 MTP 모듈 14B가 더해진 값입니다. 의미는 두 가지입니다. 첫째, 추론 속도는 활성 파라미터가 결정하므로 체감이 빠릅니다. 둘째, 가중치는 전량 적재해야 하므로 메모리 요구는 총 파라미터를 따릅니다. 그래서 MoE 대형 모델은 개인 GPU보다 대용량 통합 메모리 장비나 멀티 GPU 서버에 유리합니다.

도입 판단 체크리스트

– 사용자 데이터를 외부로 보낼 수 없는가 → 오픈웨이트 자체 호스팅 우선
– 트래픽이 불규칙하고 월 호출량이 적은가 → API가 대체로 저렴
– 파인튜닝·도메인 특화가 핵심인가 → 오픈웨이트, 단 파생 모델 재배포 조항 확인
– 대기업 서비스에 임베드하는가 → MAU 임계값·네이밍 조항 먼저 검토
– 라이선스 원문과 사용 정책 사본을 보관했는가 → 갱신 리스크 대비

요약하면, 2026년의 선택지는 “오픈이냐 클로즈드냐”가 아니라 어떤 조건의 오픈웨이트를 어느 워크로드에 붙일 것인가입니다. 라이선스 한 페이지를 먼저 읽는 30분이, 나중에 아키텍처를 되돌리는 3주를 막아줍니다.

참고 자료

Llama 4 Community License 원문 — MAU 7억 조항(2항), “Built with Llama”·네이밍 조항(1(b)(i))
Kimi K2 LICENSE — 수정 MIT의 표기 의무 발동 기준
Apache License 2.0 원문
Gemma Terms of Use
OSI Open Source AI Definition
– 모델 카드(라이선스·파라미터 출처): Qwen3-235B-A22B · gpt-oss-120b · DeepSeek-V3 · DeepSeek-R1 · Phi-4 · Mistral Small 24B
– 모델 카드 원문(텍스트): Kimi K2 · DeepSeek-V3 · Qwen3-235B-A22B · gpt-oss-120b
– 양자화 파일 크기 실측: Qwen3-8B GGUF(bartowski) · unsloth · Llama 3.1 8B · Llama 3.3 70B · Mistral Small 24B

자주 묻는 질문

오픈웨이트 모델을 상업 서비스에 써도 되나요?

라이선스에 따라 다릅니다. Apache 2.0·MIT 계열(Qwen3, gpt-oss, DeepSeek-R1, Phi-4 등)은 고지 유지만 하면 상업 이용이 자유롭습니다. 반면 Llama 커뮤니티 라이선스나 Gemma 이용약관은 사용자 규모, 네이밍, 금지 사용 정책 같은 추가 조건이 붙으므로 원문 확인이 필요합니다.

24GB VRAM 그래픽카드로 어느 정도 모델까지 돌릴 수 있나요?

4비트 양자화 기준으로 24B급 모델(파일 약 14GB)까지는 여유 있게 올라가고, 32B급도 컨텍스트를 짧게 잡으면 가능합니다. 70B급은 4비트에서도 파일이 40GB를 넘어 단일 24GB 카드로는 부족하며, CPU 오프로딩을 쓰면 속도가 크게 떨어집니다.

양자화하면 성능이 얼마나 떨어지나요?

Q5_K_M 이상에서는 대체로 체감 차이가 작고, Q4_K_M부터 긴 추론이나 형식 준수에서 미세한 저하가 나타납니다. Q3 이하는 지시 준수와 JSON 출력 안정성이 먼저 무너지는 경향이 있어, 실제 업무 프롬프트로 만든 자체 평가셋으로 등급별 비교 후 결정하는 것이 안전합니다.

자주 묻는 질문

오픈웨이트 모델을 상업 서비스에 써도 되나요?

라이선스에 따라 다릅니다. Apache 2.0·MIT 계열(Qwen3, gpt-oss, DeepSeek-R1, Phi-4 등)은 고지 유지만 하면 상업 이용이 자유롭습니다. 반면 Llama 커뮤니티 라이선스나 Gemma 이용약관은 사용자 규모, 네이밍, 금지 사용 정책 같은 추가 조건이 붙으므로 원문 확인이 필요합니다.

24GB VRAM 그래픽카드로 어느 정도 모델까지 돌릴 수 있나요?

Q4_K_M 배포본 실제 파일 크기로 보면 Mistral Small 24B가 14.33GB라 24GB 카드에 여유 있게 올라갑니다. Llama 3.3 70B는 42.52GB로 단일 24GB 카드에는 부족하며, CPU 오프로딩을 쓰면 속도가 크게 떨어집니다. 여기에 컨텍스트 길이에 비례하는 KV 캐시가 더 붙으므로 실제 로드로 확인하세요.

양자화하면 성능이 얼마나 떨어지나요?

파일 크기는 Qwen3-8B 실측 기준 Q8_0이 원본의 53%, Q5_K_M 36%, Q4_K_M 31%로 줄어듭니다. 다만 품질 저하 폭은 모델·태스크마다 달라 일반화된 수치가 없으므로, 실제 업무 프롬프트로 만든 자체 평가셋으로 등급별 비교 후 결정하는 것이 안전합니다.

Similar Posts

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다