Gemma 4 26B A4B × SillyTavern

SillyTavern에서 Gemma 4 26B 사용하기

첫 번째 함정은 이름입니다. Gemma 4 26B A4B는 총 252억, 약 38억 active parameters를 가진 MoE 모델입니다. dense 26B도 31B 체크포인트도 아닙니다. 이름, 메모리, 템플릿, 프런트엔드 순서로 설정을 확인하세요.

Google 모델 카드
공식 모델 정보 확인
세로 탭, 중앙 입력창과 오른쪽 채팅 패널이 보이는 Tabbit 데스크톱 브라우저.

이름과 하드웨어부터

26B A4B는 MoE이므로 숫자만 보면 안 됩니다

Google의 공식 이름은 Gemma 4 26B A4B입니다. 모델 카드는 총 252억 파라미터, 38억 active parameters, 30개 레이어, 이미지 입력과 256K 컨텍스트를 명시합니다. GGUF의 IT, Q4, Q5, 제작자 이름은 배포 라벨입니다.

01

정확한 모델 ID 사용

Hugging Face 지시 튜닝 체크포인트는 `google/gemma-4-26B-A4B-it`입니다. Q4, Q5, Q6는 양자화 배포판이지 Google의 새 모델군이 아닙니다.

02

가중치와 컨텍스트를 함께 계산

active parameters는 속도를 설명하지만 모든 파일이 4GB가 된다는 뜻은 아닙니다. 가중치, 런타임 버퍼, 약 5.5억 파라미터 비전 인코더, KV cache와 컨텍스트가 메모리를 사용합니다.

03

31B 설정을 그대로 쓰지 않기

31B는 약 307억 파라미터의 dense 모델입니다. 26B A4B는 토큰을 expert로 라우팅합니다. 31B용 메모리 추정과 프리셋은 맞지 않을 수 있습니다.

SillyTavern 연결 순서

캐릭터 카드보다 backend를 먼저 연결

레이어를 나누어 테스트하면 템플릿, sampler와 카드 중 어디가 문제인지 알 수 있습니다.

  1. 01

    1. checkpoint 확인

    Gemma 4 26B A4B라고 명시된 로컬 파일이나 제공업체 버전을 선택하세요. `gemma-4-26b`를 기억으로 입력하지 말고 model slug를 복사하세요.

  2. 02

    2. API 모드 선택

    KoboldCpp, llama.cpp, LM Studio와 OpenAI 호환 제공업체는 endpoint가 다릅니다. 지원한다면 먼저 Chat Completions를 사용하고 Text Completion의 수동 설정은 뒤로 미루세요.

  3. 03

    3. tokenizer와 템플릿 정렬

    Google 형식은 `system`, `user`, `model`, `<|turn>`, `<turn|>`를 사용합니다. backend가 제공하는 Gemma 4 또는 Gemini 설정을 사용하고 오래된 Gemma 3 템플릿을 덮어쓰지 마세요.

  4. 04

    4. thinking을 의도적으로 테스트

    Google은 system prompt 앞에 `<|think|>`를 두면 thinking을 켤 수 있다고 안내합니다. 짧은 입력으로 시험한 뒤 카드와 preset을 추가하고 일반 대화 기록에는 최종 답만 남기세요.

커뮤니티에서는 SillyTavern 1.17, KoboldCpp `--jinja`, Gemma4/Gemini tokenizer와 `<|think|>`가 언급됩니다. 모든 backend에 적용되는 Google 기본값은 아닙니다.

출력이 이상할 때

실패한 레이어만 고치세요

CASE 01

thinking 토큰이 본문으로 보임

tokenizer, chat template와 backend 생성 모드를 확인하세요. backend가 이미 템플릿을 적용한다면 토큰을 직접 넣을 때 그대로 노출될 수 있습니다. 짧은 입력으로 on/off를 비교하세요.

CASE 02

thinking이 일관되지 않음

SillyTavern과 loader가 Gemma 4 형식을 지원하는지 확인하세요. `--jinja`나 `<|think|>`가 필요할 수 있지만 올바른 설정은 서버에 따라 달라집니다.

CASE 03

캐릭터가 반복하거나 세부사항을 잃음

온도를 바꾸기 전에 중복 컨텍스트를 줄이세요. 한도와 카드를 확인한 후 temperature 1.0, top-p 0.95, top-k 64를 실험 시작점으로 사용하세요.

브라우저 대안

캐릭터 wiki를 열어 둔 채 옆에서 질문하기

Tabbit은 로컬 GGUF 실행기나 SillyTavern 카드 관리자가 아닙니다. wiki, 설정 메모와 문제 해결 글을 보면서 브라우저에서 제공되는 모델과 대화하는 경로입니다.

  1. 1

    Tabbit 설치

    macOS 또는 Windows용 Chromium 기반 브라우저를 받으세요. 로컬 Gemma 파일, 제공업체 키와 SillyTavern 서버가 필요하지 않습니다.

  2. 2

    목록에 있는 모델만 선택

    설치 후 제품 모델 선택기를 여세요. 현재 코드에는 GPT-5.4, Gemini-3.1-Pro, Claude-Sonnet-4.6, DeepSeek-V4-Flash 등이 있습니다. 현재 mapping에 Gemma 4가 없으므로 실행을 약속하지 않습니다.

  3. 3

    자료를 대화에 참조

    wiki나 설정 메모를 탭에 남기고 `@`로 페이지, 스크린샷, 파일을 참조하세요. 장면 구성, 일관성 점검과 설정 요약을 요청할 수 있습니다.

Tabbit 새 탭 모델 선택기에 GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash, Claude-Sonnet-4.6이 표시됩니다. Gemma 4는 보이지 않습니다.

클라이언트 선택

카드는 SillyTavern, 자료 페이지는 Tabbit

두 도구가 해결하는 병목이 다릅니다. 세밀한 RP 제어는 전용 프런트엔드로, 자료가 페이지와 파일에 흩어졌다면 브라우저로 처리하세요.

SillyTavernTabbit
캐릭터 카드와 lorebook핵심 흐름출처 페이지 참조
Gemma 4 로컬 checkpointbackend 직접 준비선택기에 있는 모델 사용
템플릿과 sampler세밀한 제어선택 모델이 관리
웹 컨텍스트붙여넣기 또는 확장@로 탭과 파일 참조
첫 유용한 답변endpoint + template + preset설치 + 모델 선택
Tabbit 새 탭 모델 선택기에 GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash, Claude-Sonnet-4.6이 표시됩니다. Gemma 4는 보이지 않습니다.

자료를 대화에 참조

wiki나 설정 메모를 탭에 남기고 `@`로 페이지, 스크린샷, 파일을 참조하세요. 장면 구성, 일관성 점검과 설정 요약을 요청할 수 있습니다.

Tabbit 새 탭 모델 선택기에 GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash, Claude-Sonnet-4.6이 표시됩니다. Gemma 4는 보이지 않습니다.

웹 컨텍스트

@로 탭과 파일 참조

FAQ

Gemma 4 26B A4B와 SillyTavern

Gemma 4 26B의 공식 이름은 무엇인가요?+

Google 모델 카드는 Gemma 4 26B A4B라고 부릅니다. Hugging Face 지시 튜닝 checkpoint는 `google/gemma-4-26B-A4B-it`이며 배포자가 접미사를 추가할 수 있습니다.

26B A4B는 31B와 같은 모델인가요?+

아닙니다. 26B A4B는 총 252억, active parameters 약 38억의 MoE입니다. 31B는 약 307억 파라미터의 dense 모델입니다.

VRAM은 얼마나 필요한가요?+

고정된 답은 없습니다. 양자화 가중치, KV cache, 컨텍스트, 런타임 버퍼와 비전 인코더가 모두 영향을 줍니다. 사용할 컨텍스트로 실제 파일을 측정하세요.

왜 `<|think|>`가 답변에 보이나요?+

tokenizer나 template이 backend와 맞지 않거나 서버가 제어 토큰을 텍스트로 노출했을 수 있습니다. 샘플링보다 형식과 thinking 설정을 먼저 확인하세요.

Tabbit에서 Gemma 4 26B를 실행할 수 있나요?+

그렇다고 가정하지 마세요. 현재 Tabbit mapping에 Gemma 4가 없습니다. 설치 후 선택기에 표시되는 모델만 사용하세요.

preset보다 모델 경로를 먼저 확인하세요

로컬 Gemma 4 26B A4B는 checkpoint, 메모리, tokenizer와 template을 차례로 확인하세요. wiki 옆에서 대화하려면 Tabbit을 설치하고 현재 모델 선택기를 확인하세요.

macOS와 Windows 지원. 모델 제공 여부는 바뀔 수 있습니다.

© 2026 Tabbit Browser. 당신의 맥락을 이해하는 AI 네이티브 브라우저.