구글 Gemma 4 완벽 가이드: Apache 2.0 오픈 모델의 새 기준

오픈소스 LLM을 돌려본 적 있다면, 모델 성능은 만족스러운데 라이선스 조항을 읽다가 한숨을 쉰 경험이 있을 것이다. “상업적 사용 가능”이라고 써놓고 사용자 수 제한이 붙어 있거나, 파인튜닝한 모델의 재배포 조건이 애매한 경우가 다반사였다. Google이 2026년 4월 2일 공개한 Gemma 4는 이…

오픈소스 LLM을 돌려본 적 있다면, 모델 성능은 만족스러운데 라이선스 조항을 읽다가 한숨을 쉰 경험이 있을 것이다. “상업적 사용 가능”이라고 써놓고 사용자 수 제한이 붙어 있거나, 파인튜닝한 모델의 재배포 조건이 애매한 경우가 다반사였다. Google이 2026년 4월 2일 공개한 Gemma 4는 이 문제를 정면으로 해결한다.

TL;DR — Gemma 4는 Apache 2.0 라이선스 + MoE 아키텍처(26B 중 3.8B만 활성) + 256K 컨텍스트 + 네이티브 멀티모달(이미지/오디오/비디오)을 갖춘 Google의 최신 오픈 웨이트 모델이다. 수학/코딩 벤치마크에서 오픈 모델 최강이며, 엣지(E2B/E4B)부터 서버(31B)까지 4가지 사이즈를 제공한다.

Gemma 4가 중요한 이유

한 줄로 요약하면: 성능 최상위 + Apache 2.0 + 엣지부터 서버까지 전 계층 커버.

Gemma 시리즈는 Google DeepMind가 Gemini의 연구 기반을 오픈 웨이트로 공개하는 프로젝트다. Gemma 4에서는 세 가지가 동시에 바뀌었다.

  1. 라이선스가 Apache 2.0으로 전환됐다. 사용자 수 제한 없음, 재배포 자유, 상용화 제약 없음.
  2. Mixture of Experts(MoE) 아키텍처가 Gemma 시리즈 최초로 도입됐다.
  3. 이미지뿐 아니라 오디오와 비디오를 네이티브로 처리한다.

Gemma 시리즈 변천사

버전 출시일 주요 변화
Gemma 1 2024-02 2B, 7B로 시작
Gemma 2 2024-06 9B, 27B, 텍스트 전용
Gemma 3 2025-03 멀티모달(이미지), 128K 컨텍스트, 140개 언어
Gemma 4 2026-04 MoE, Apache 2.0, 256K, 오디오/비디오, 네이티브 함수 호출

Apache 2.0: 벤치마크보다 중요한 변화

VentureBeat는 “Apache 2.0 라이선스 변경이 벤치마크 3위보다 더 중요할 수 있다”고 평가했다. 과장이 아니다.

이전 Gemma 시리즈는 커스텀 ToS(Terms of Service)를 사용했다. 상업적 사용은 가능했지만, 세부 조항이 기업 법무팀을 긴장시키는 구조였다. Llama 4도 MAU 700M 이상인 앱에서는 별도 허가가 필요하다.

Apache 2.0은 다르다:

  • 상업적 사용: 무제한
  • 수정/파인튜닝: 자유
  • 재배포: 자유
  • 사용자 수 제한: 없음

기업 입장에서 “법무 리뷰 없이 쓸 수 있는 고성능 오픈 모델”이 생긴 셈이다.

Google의 전략: 왜 지금 Apache 2.0인가

Gemma 4는 단순한 모델 출시가 아니다. Google의 오픈소스 AI 전략에서 중요한 전환점이다.

  1. 중국 오픈소스 대응: Qwen, DeepSeek 등 중국 모델이 오픈소스 시장을 장악하는 흐름에 직접 대응한다.
  2. Android 생태계 잠금: AICore → Gemma 4 네이티브 통합 → Android Studio 에이전트 → Google Cloud 배포로 이어지는 풀스택 체인을 구축한다.
  3. 개발자 유인: 라이선스 제약으로 Qwen/Mistral로 이탈하던 개발자를 Apache 2.0으로 복귀시킨다.

Gemma 4 모델 라인업: 4가지 사이즈, 2가지 아키텍처

Gemma 4는 엣지용 소형 모델과 워크스테이션용 대형 모델로 나뉜다.

모델 총 파라미터 활성 파라미터 컨텍스트 아키텍처 대상
E2B ~2.3B 2B 128K Dense (PLE) 모바일, IoT
E4B ~4B 4B 128K Dense (PLE) 노트북, 엣지 서버
26B A4B 26B 3.8B 256K MoE 소비자 GPU
31B 30.7B 30.7B 256K Dense 서버, 파인튜닝 베이스

핵심은 26B MoE 모델이다. 총 26B 파라미터 중 추론 시 3.8B만 활성화하기 때문에, 토큰당 연산 비용은 극적으로 줄어든다. 다만 주의할 점이 있다: 활성 파라미터는 3.8B이지만, 추론 시 26B 전체 가중치를 VRAM에 올려야 하므로 최소 24GB 이상의 GPU 메모리가 필요하다.

엣지 모델(E2B/E4B)은 텍스트 + 이미지 + 비디오 + 오디오까지 네이티브 지원한다. 대형 모델(26B/31B)은 텍스트 + 이미지 + 비디오(최대 60초, 1fps)를 처리한다.


Gemma 4 아키텍처: 무엇이 달라졌나

기술 심화 섹션이다. 개념보다 실용이 목적이라면 벤치마크로 건너뛰어도 좋다.

Interleaved Attention

모든 Gemma 4 모델은 로컬 슬라이딩 윈도우 어텐션글로벌 풀 어텐션을 교차 배치한다.

  • E2B: 로컬 4개 → 글로벌 1개 (4:1)
  • 나머지 모델: 로컬 5개 → 글로벌 1개 (5:1)
  • 마지막 레이어는 항상 글로벌 어텐션

로컬 레이어는 가까운 토큰만 보고, 글로벌 레이어가 전체 컨텍스트를 커버하는 구조다. 이 방식으로 256K 컨텍스트를 효율적으로 처리한다.

GQA (Grouped Query Attention)

글로벌 어텐션에서 8개의 Query 헤드가 1개의 KV 헤드를 공유한다. KV 캐시 메모리가 대폭 줄어들어 긴 컨텍스트에서도 실용적인 메모리 사용량을 유지한다.

MoE (26B 모델 전용)

FFN(Feed-Forward Network) 레이어 전체를 Mixture of Experts로 교체했다. 전문가 네트워크 중 일부만 활성화하므로, 26B 총 파라미터에서 3.8B만 실제 연산에 참여한다.

결과적으로 토큰당 연산 비용이 Dense 모델 대비 극적으로 줄어든다. 다만 출시 초기에는 추론 속도가 Qwen 동급 대비 느리다는 보고가 있었다.


Gemma 4 벤치마크: 숫자로 보는 성능

Gemma 4 31B vs 경쟁 모델

벤치마크 Gemma 4 31B Qwen 3.5 27B Llama 4 Scout (17B 활성)
MMLU Pro 85.2% 86.1% ~80%
GPQA Diamond 84.3% 85.5% ~78%
AIME 2026 89.2% 48.7% ~35%
LiveCodeBench v6 80.0% ~76% ~71%
Codeforces ELO 2150

수학과 코딩에서 압도적이다. AIME 2026에서 89.2%는 Qwen 3.5(48.7%)의 거의 2배에 달한다. 반면 일반 지식(MMLU Pro, GPQA)에서는 Qwen 3.5가 소폭 앞선다.

Gemma 3 → 4 개선 폭

벤치마크 Gemma 3 27B Gemma 4 31B 개선율
AIME 2026 20.8% 89.2% +329%
LiveCodeBench v6 29.1% 80.0% +175%
GPQA Diamond ~51% 84.3% +65%

전작 대비 개선 폭이 상당하다. 특히 수학/코딩 추론 영역에서 세대 간 격차가 크다.

Arena AI 랭킹

Gemma 4 31B는 Arena AI(LMSYS) 텍스트 벤치마크에서 오픈 모델 중 최상위권에 위치한다. 클로즈드 모델을 포함한 전체 순위에서도 상위 30위권으로, 30B급 오픈 모델로서는 인상적인 성과다.


경쟁 모델 비교: Gemma 4 vs Llama 4 vs Qwen 3.5

2026년 4월은 오픈소스 AI 역사상 가장 치열한 달이다. Gemma 4와 같은 날 Alibaba가 Qwen 3.6-Plus를 공개했고, Llama 4는 이미 시장에 자리 잡고 있다.

항목 Gemma 4 Llama 4 Qwen 3.5
라이선스 Apache 2.0 Llama License (MAU 700M 제한) Apache 2.0
최소 모델 2.3B 109B (총) 0.8B
플래그십 활성 파라미터 31B / 3.8B(MoE) 17B 27B
최대 컨텍스트 256K 10M 256K (3.6-Plus: 1M)
엣지 모델 E2B/E4B 없음 0.8B~3B
네이티브 멀티모달 이미지+오디오+비디오 이미지 이미지
수학/코딩 최강 약세 중상
일반 지식 중상 최강

누구에게 어떤 모델이 맞나

  • 상용화 프로젝트: Gemma 4 또는 Qwen 3.5 (Apache 2.0). Llama 4는 사용자 수 제한 주의.
  • 수학/코딩 에이전트: Gemma 4 31B가 현재 오픈 모델 최강.
  • 장문서 RAG: Llama 4(10M) 또는 Qwen 3.6-Plus(1M). Gemma 4의 256K는 상대적 약세.
  • 엣지/온디바이스: Gemma 4 E2B/E4B. 경쟁 모델 중 엣지 라인업이 가장 탄탄하다.
  • 한국어 특화: Qwen 시리즈가 CJK 학습 데이터 측면에서 여전히 강세.

Gemma 4 설치 방법과 시작하기

Ollama (가장 간단)

# Ollama 0.20 이상 필요
ollama pull gemma4:e4b        # 노트북용 (4B)
ollama pull gemma4:26b-a4b    # 워크스테이션용 (MoE)
ollama run gemma4:e4b

Hugging Face Transformers

# transformers 5.5.0 이상 필요
pip install transformers>=5.5.0

from transformers import AutoTokenizer, AutoModelForCausalLM

model_id = "google/gemma-4-31B-it"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)

Google AI Studio

별도 설치 없이 웹에서 31B, 26B MoE 모델을 즉시 테스트할 수 있다.

지원 프레임워크

카테고리 도구
Python 추론 Hugging Face Transformers, TRL
고성능 서빙 vLLM, SGLang, Baseten
NVIDIA NIM, NeMo
로컬 실행 Ollama, llama.cpp, LM Studio, MLX
파인튜닝 Unsloth, Keras
모바일 Google AI Edge, AICore (Android)

Gemma 4 활용 사례: 에이전트, 온디바이스, 파인튜닝

에이전트 구축

Gemma 4는 네이티브 함수 호출을 지원한다. instruction-following 방식이 아니라, 처음부터 function calling용으로 훈련됐다. 구조화된 JSON 출력도 안정적이다.

Google은 GKE Agent Sandbox와 조합해 초당 300개 샌드박스, sub-second 콜드스타트로 멀티스텝 에이전트를 안전하게 실행하는 사례를 공식 소개했다.

온디바이스 AI

E2B 모델은 스마트폰, Raspberry Pi, Jetson Orin Nano에서 구동된다. Gemma 3 대비 최대 4배 빠르고, 배터리 소모는 60% 줄었다. Android AICore Developer Preview에 공식 통합되어 있다.

파인튜닝

E2B/E4B는 소비자 GPU 단일 카드에서 QLoRA로 수 시간 내 파인튜닝할 수 있다. 31B Dense는 고품질 파인튜닝 베이스로, NVIDIA NeMo + NIM 스택으로 프로덕션 배포까지 가능하다.

다만 출시 초기에 Gemma4ClippableLinear라는 신규 레이어 타입이 기존 PEFT와 호환되지 않는 문제가 보고됐다. 커뮤니티가 빠르게 몽키패치를 공유해 해결했다.


Gemma 4 제한사항과 커뮤니티 반응

솔직하게 짚어야 할 부분도 있다.

항목 상세
컨텍스트 길이 256K로 Llama 4(10M), Qwen 3.6-Plus(1M)에 밀림
MoE 추론 속도 출시 초기 Qwen 동급 대비 현저히 느림 (11 vs 60+ TPS)
지식 컷오프 2025년 1월 (출시 기준 약 15개월 지연)
오디오 처리 최대 30초 세그먼트 제한
비디오 처리 최대 60초, 1fps
출시 초기 버그 토크나이저 멀티바이트 문자 누락, 무한 토큰 생성 등

특히 MoE 추론 속도 문제는 Hacker News에서 집중적으로 지적됐다. 같은 GPU에서 Qwen 대비 5~6배 느린 토큰 생성 속도가 보고됐다. 이 부분은 서빙 프레임워크 최적화로 점진적 개선이 예상된다.

한국어 성능도 별도 벤치마크가 공개되지 않았다. 140개 이상 언어를 프리트레인에 포함했지만, 한국어 특화 작업(법률, 의료, 뉴스 요약 등)에서는 Qwen이나 EXAONE 대비 품질 검증이 필요하다.

커뮤니티에서는 Apache 2.0 전환이 가장 큰 반향을 일으켰고, E2B의 성능/크기 비율을 “게임 체인저”로 평가하는 반응이 많았다. 반면 Mac 환경에서 LM Studio 하드 크래시, AI Studio에서 이미지 추론 무한 루프 등 출시 초기 안정성 문제도 보고됐다. 출시 24시간 내 토크나이저 버그 3건이 발견됐지만 커뮤니티가 자체 해결했다.


마무리: 누가 주목해야 하나

당신이 이런 사람이라면 Gemma 4에서 주목할 점
사이드 프로젝트에 LLM을 쓰고 싶은 개발자 Apache 2.0 + Ollama 원커맨드 설치
홈서버에서 로컬 AI를 돌리는 홈래버 26B MoE를 소비자 GPU로 구동
모바일 앱에 AI를 넣으려는 앱 개발자 E2B/E4B + Android AICore
상용 서비스에 오픈 모델을 도입하려는 기업 Apache 2.0 라이선스, 법무 리뷰 불필요
수학/코딩 에이전트를 만드는 AI 엔지니어 AIME 89.2%, 네이티브 function calling

Gemma 4가 모든 면에서 최고는 아니다. 컨텍스트 길이는 Llama 4에 밀리고, 일반 지식은 Qwen 3.5가 소폭 앞서며, 추론 속도는 개선이 필요하다. 하지만 Apache 2.0 + MoE 효율 + 엣지-서버 풀 라인업이라는 조합은 현재 다른 어떤 오픈 모델도 제공하지 못한다.


참고 링크

관련 글

@welltip

정리를 위해 작성하는 개인노트