라마 4 스카우트와 매버릭의 실제 사양 정리: 2026년 메타 오픈웨이트 모델과 뮤즈 라인업까지

· AI & 바이브코딩

■ 1. 먼저 숫자부터 바로잡습니다

라마 4에 관해 인터넷에서 가장 자주 잘못 인용되는 대목이 파라미터 수와 컨텍스트 길이입니다. 매버릭이 2조 파라미터라거나, 매버릭이 1,000만 토큰 컨텍스트를 지원한다는 설명이 널리 퍼져 있는데 둘 다 사실과 다릅니다. 공개된 사양은 다음과 같습니다.

- 라마 4 스카우트(Scout): 전체 파라미터 약 1,090억 개, 토큰당 활성 파라미터 170억 개, 전문가 16개. 명령어 조정 버전 기준 컨텍스트는 1,000만 토큰입니다.

- 라마 4 매버릭(Maverick): 전체 파라미터 약 4,000억 개, 토큰당 활성 파라미터 170억 개, 전문가 128개. 명령어 조정 버전 기준 컨텍스트는 100만 토큰입니다.

- 라마 4 베히모스(Behemoth): 전체 약 2조 개, 활성 2,880억 개 규모로 예고된 모델입니다. 다만 공개된 적이 없습니다.

즉 2조 파라미터는 매버릭이 아니라 베히모스의 예고 수치이고, 1,000만 토큰은 매버릭이 아니라 스카우트의 사양입니다. 두 항목이 뒤섞여 인용되면서 잘못된 설명이 굳어졌습니다.

라마 4 스카우트와 매버릭은 2025년 4월 5일에 공개됐습니다. 2026년 시점의 신규 발표가 아니라 이미 1년 이상 사용된 모델이라는 점도 함께 알아 두는 편이 좋습니다.

■ 2. 전문가 혼합 구조가 의미하는 것

라마 4는 메타가 내놓은 첫 전문가 혼합(MoE, Mixture-of-Experts) 계열 모델입니다. 이 구조에서는 모델 전체 파라미터가 여러 개의 전문가 블록으로 나뉘고, 토큰 하나를 처리할 때 그중 일부만 활성화됩니다.

- 전체 파라미터는 메모리에 올려야 하는 양을 결정합니다.

- 활성 파라미터는 토큰 하나를 처리할 때 실제로 계산되는 양을 결정합니다.

매버릭의 전체 4,000억 개와 활성 170억 개라는 조합이 여기서 나옵니다. 저장 공간은 4,000억 개 규모를 요구하지만, 추론 속도와 연산량은 170억 개 규모에 가깝게 나옵니다. 그래서 "매버릭이 크니까 무조건 느리다"는 식의 단정은 맞지 않습니다. 반대로 "활성이 작으니 가벼운 GPU에서 돌아간다"는 말도 맞지 않습니다. 전체 가중치를 올릴 메모리는 여전히 필요하기 때문입니다.

스카우트는 상황이 조금 다릅니다. 전체 1,090억 개 규모지만 int4 양자화를 적용하면 서버급 GPU 한 장에서 구동할 수 있도록 설계됐습니다. 매버릭은 BF16과 FP8 형식으로 제공됩니다.

■ 3. 사전학습과 멀티모달 처리

- 사전학습 토큰: 최대 40조 토큰 규모의 데이터로 학습했다고 밝혔습니다.

- 사전학습 컨텍스트 길이: 두 모델 모두 25만 6천 토큰으로 사전학습했습니다. 앞서 언급한 1,000만 토큰과 100만 토큰은 이후 확장 처리를 거친 명령어 조정 버전의 지원 범위입니다.

- 언어: 200개 언어 데이터를 포함해 학습했고, 그중 12개 언어를 공식 지원 대상으로 명시했습니다.

- 멀티모달: 초기 융합(early fusion) 방식으로 텍스트와 이미지 입력을 함께 처리합니다. 텍스트, 이미지, 오디오, 비디오를 모두 하나의 입력으로 받는다고 설명한 자료가 있으나 공개 사양은 텍스트와 이미지 입력 기준입니다.

컨텍스트가 길다는 사실과, 그 길이를 채웠을 때 품질이 유지된다는 사실은 별개입니다. 긴 문서를 통째로 넣을 수 있다고 해서 정확도가 자동으로 보장되지는 않으므로, 실제 업무 데이터로 검증한 뒤 적용 범위를 정하는 편이 안전합니다.

■ 4. 라이선스에서 놓치기 쉬운 조항

라마 4는 오픈소스 표준 라이선스가 아니라 별도의 라마 4 커뮤니티 라이선스로 배포됩니다. 흔히 오픈소스라고 부르지만 정확한 표현은 오픈웨이트에 가깝습니다.

- 월간 활성 사용자 수가 7억 명을 넘는 서비스는 별도 허가가 필요하다는 조항이 포함돼 있습니다.

- 결과물 표기 및 파생 모델 명명에 관한 조건이 있습니다.

- 지역별 사용 제한 조항이 붙는 경우가 있으므로, 서비스 대상 국가를 기준으로 라이선스 원문을 확인해야 합니다.

상업 서비스에 넣을 계획이라면 법무 검토를 도입 절차에 포함하는 것이 좋습니다.

■ 5. 안전 도구와 2026년 메타 모델 현황

메타는 라마 계열과 함께 몇 가지 안전 도구를 공개했습니다. 라마 가드(Llama Guard)는 입출력을 정책 분류 체계에 따라 판정하는 모델이고, 프롬프트 가드(Prompt Guard)는 프롬프트 주입과 탈옥 시도로 보이는 입력을 탐지합니다. 사이버섹이밸(CyberSecEval)은 보안 관점의 평가 도구 모음입니다. 이들 도구는 위험을 줄이는 보조 수단이지 완전한 차단 장치가 아니므로, 서비스 단에서 별도의 검토 절차와 로그 점검을 함께 두어야 합니다.

2026년 메타의 모델 라인업은 라마만으로 설명되지 않습니다.

- 뮤즈 스파크(Muse Spark): 2026년에 공개된 가중치 비공개 API 기반 모델입니다. 메타의 자체 서비스에서 주로 제공됩니다.

- 뮤즈 글리머(Muse Glimmer) 30B: 2026년 8월 10일 공개된 약 300억 파라미터 규모의 모델로, 아파치 2.0 라이선스로 배포됩니다. 사용자 수 조건이나 지역 제한 조항이 없는 표준 오픈소스 라이선스라는 점이 라마 계열과 다릅니다.

- 라마 5: 2026년 8월 기준 공개되지 않았습니다.

따라서 라이선스 제약 없는 오픈웨이트 모델이 필요하다면 라마 4보다 뮤즈 글리머 쪽을 먼저 검토하는 편이 합리적입니다.

■ 6. 도입 체크리스트

- 필요한 컨텍스트 길이를 실제 문서 크기로 계산합니다. 대부분의 사내 문서 업무는 10만 토큰 이내에서 처리됩니다.

- 전체 파라미터 기준으로 GPU 메모리 요구량을 산정합니다. 활성 파라미터 기준으로 계산하면 반드시 부족해집니다.

- 양자화 수준별로 품질 저하를 직접 측정합니다. int4 적용 후 성능이 업무 기준을 충족하는지 확인해야 합니다.

- vLLM이나 올라마 같은 추론 엔진 중 어떤 것을 쓸지 정하고, 해당 엔진이 대상 모델 형식을 지원하는지 확인합니다.

- 라이선스 조항을 서비스 규모와 대상 지역 기준으로 검토합니다.

- 안전 필터를 켠 상태와 끈 상태의 결과 차이를 미리 확인합니다.

■ 7. 자주 묻는 질문

▶ 베히모스는 언제 나오나요

2026년 8월 기준 공개되지 않았고 공식적인 취소 발표도 없습니다. 학습 과정의 문제로 공개가 미뤄졌다는 보도가 있었으나 확정된 일정은 없습니다.

▶ 스카우트의 1,000만 토큰을 실제로 다 쓸 수 있나요

사양상 지원 범위이지만, 그 길이를 채우려면 상당한 메모리와 시간이 필요합니다. 실사용에서는 필요한 부분만 검색해 넣는 방식이 비용과 정확도 모두에서 유리한 경우가 많습니다.

▶ 오픈웨이트 모델이 상용 모델을 대체할 수 있나요

업무 성격에 따라 다릅니다. 데이터를 외부로 내보낼 수 없는 환경이나 대량 처리로 단가를 낮춰야 하는 경우에는 장점이 크고, 최고 수준의 추론 성능이 필요한 작업에서는 아직 차이가 남아 있습니다.

■ 8. 용어 정리

- 오픈웨이트: 모델 가중치를 내려받을 수 있지만 라이선스에 별도 조건이 붙는 배포 방식입니다.

- 전문가 혼합(MoE): 전체 파라미터를 여러 블록으로 나누고 토큰마다 일부만 활성화하는 구조입니다.

- 활성 파라미터: 토큰 하나를 처리할 때 실제로 계산에 참여하는 파라미터 수입니다.

- 양자화: 가중치를 낮은 비트 수로 표현해 메모리를 줄이는 기법입니다. int4, FP8 등이 있습니다.

- 증류(Distillation): 큰 모델의 출력을 이용해 작은 모델을 학습시키는 방법입니다.

■ 안내

이 글은 2026년 8월 기준으로 정리한 내용입니다. AI 모델과 서비스의 사양·요금·정책은 수개월 단위로 바뀌므로, 실제 도입 전에는 각 서비스의 공식 문서를 반드시 확인하시기 바랍니다.