Aspectos destacados
Gemma 3 27B es un LLM multimodal de código abierto lanzado por Google en marzo de 2025.
Admite más de 140 idiomas con un nuevo tokenizador y una ventana de contexto de 128K.
Procesa entrada de texto e imagen y genera texto.
Entrenado con 14 billones de tokens, destaca en matemáticas, código y seguimiento de instrucciones.
Puntuaciones en benchmarks: 1339 Elo, 69.0 (MATH), 67.5 (MMLU-Pro).
Puede ejecutarse en una única NVIDIA H100 o desplegarse mediante Ollama (local) o API / GPU en la nube de Novita AI.
Gemma 3 27B es un LLM potente y flexible creado por Google. Combina alcance multilingüe, entrada multimodal y alto rendimiento, lo que lo hace ideal para diversas cargas de trabajo de IA, tanto local como en la nube.
¿Qué es Gemma 3 27B?
Características destacadas
- Soporte multilingüe avanzado: Con su nuevo tokenizador, Gemma 3 es muy eficaz en más de 140 idiomas.
- Entrada multimodal: La capacidad de procesar tanto imágenes como texto lo convierte en una herramienta versátil para diversas aplicaciones.
- Ventana de contexto extendida: La capacidad de 128K tokens permite manejar entradas extensas y detalladas.
- Código abierto y amigable con la comunidad: Al ser de código abierto, el modelo fomenta la experimentación comunitaria y una adopción amplia.
| Categoría | Elemento | Detalles |
|---|---|---|
| Información básica | Fecha de lanzamiento | 12 de marzo de 2025 |
| Tamaño del modelo | 27 mil millones de parámetros | |
| Código abierto | Sí (publicado por Google) | |
| Soporte de idiomas | Idiomas multilingües admitidos | Más de 140 idiomas |
| Entrenamiento | Datos de entrenamiento | 14 billones de tokens |
| Fortalezas | Matemáticas, programación, seguimiento de instrucciones | |
| Multimodal | Capacidad multimodal | Sí (procesa imágenes y texto, genera texto) |
| Contexto | Ventana de contexto | 128K tokens |
| Tamaño del modelo por precisión | bf16 (sin comprimir) | Pesos: 54.0 GB; Pesos + caché KV: 72.7 GB |
| INT4 | Pesos: 14.1 GB; Pesos + caché KV: 32.8 GB | |
| INT4 (bloques=32) | Pesos: 15.3 GB; Pesos + caché KV: 34.0 GB | |
| SFP8 | Pesos: 27.4 GB; Pesos + caché KV: 46.1 GB |
Benchmarks de Gemma 3 27B
| Benchmark | Gemma 3 27B | DeepSeek R1 | LLaMA 3.3 70B |
|---|---|---|---|
| Puntuación LMSys Elo | 1339 | ~1360 | ~1260 |
| MMLU-Pro | 67.5 | 84.0 | 66.4 |
| LiveCodeBench | 29.7 | 65.9 | ~29 |
| GPQA Diamond | 42.4 | 71.5 | 50.5 |
| MATH | 69.0 | 97.3 | 77.0 |
¿Cómo acceder a Gemma 3 27B localmente?
Requisitos de hardware
Gemma 3 27B está descrito como el “modelo más potente que se puede ejecutar en una sola GPU”.
De Google
| Configuración | Requisito de VRAM | Notas |
|---|---|---|
| Implementación en la nube | Aproximadamente 80 GB de VRAM (una o varias GPU) | Se recomiendan GPU A100 o H100 para un rendimiento óptimo en la nube. También RTX 4090 24 GB (x3) |
| Apple Silicon | Gemma 3 4B compatible mediante mlx-vlm | Gemma 3 4B se lanza con soporte desde el día cero en mlx-vlm, una biblioteca de código abierto para ejecutar modelos de visión y lenguaje en dispositivos Apple Silicon, incluidos Macs y iPhones. |
Proceso paso a paso para instalar Gemma 3 27B localmente
# Step 0: Check NVIDIA GPU
nvidia-smi
# Step 1: Update Ubuntu package sources
apt update
# Step 2: Install Ollama dependencies for GPU detection
apt install pciutils lshw
# Step 3: Install Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Step 4: Start Ollama server (run this in one terminal and keep it open)
ollama serve
# Step 5: (In a new terminal) Check if Ollama is working
ollama
# Step 6: Install Gemma-3 models (choose one)
# Run Gemma-3 1B
# ollama run gemma3:1b
# Run Gemma-3 4B
# ollama run gemma3:4b
# Run Gemma-3 12B
# ollama run gemma3:12b
# ✅ Recommended: Run Gemma-3 27B
ollama run gemma3:27b
# Step 7: Interact with the model directly via prompt in the console
# Example:
# You are an AI-powered trading analyst specializing in cryptocurrency markets.
# Your task is to design an autonomous AI agent that can predict market trends,
# execute trades, and manage risks efficiently. Your response should include:
# - A strategy for analyzing on-chain + off-chain data
# - Model choice for price prediction and sentiment
# - A Python code snippet
# - Risk management methods
# - Ethical concerns
¿Cómo acceder a Gemma 3 27B mediante la API de Novita?
Paso 1: Inicia sesión y accede a la biblioteca de modelos
Inicia sesión en tu cuenta y haz clic en el botón Model Library (Biblioteca de modelos).

¡Prueba Gemma 3 27B Demo ahora!
Paso 2: Comienza tu prueba gratuita
Inicia tu prueba gratuita para explorar las capacidades del modelo seleccionado.

Paso 3: Obtén tu clave de API
Para autenticarte en la API, te proporcionaremos una nueva clave de API. Ingresa a la página “Settings” (Configuración) y copia la clave de API como se indica en la imagen.

Paso 4: Instala la API
Instala la API usando el gestor de paquetes específico de tu lenguaje de programación.

Después de la instalación, importa las bibliotecas necesarias en tu entorno de desarrollo. Inicializa la API con tu clave de API para comenzar a interactuar con Novita AI LLM. Este es un ejemplo de uso de la API de completaciones de chat para usuarios de Python.
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="<TU Clave de API de Novita AI>",
)
model = "google/gemma-3-27b-it"
stream = True # or False
max_tokens = 2048
system_content = """Be a helpful assistant"""
temperature = 1
top_p = 1
min_p = 0
top_k = 50
presence_penalty = 0
frequency_penalty = 0
repetition_penalty = 1
response_format = { "type": "text" }
chat_completion_res = client.chat.completions.create(
model=model,
messages=[
{
"role": "system",
"content": system_content,
},
{
"role": "user",
"content": "Hi there!",
}
],
stream=stream,
max_tokens=max_tokens,
temperature=temperature,
top_p=top_p,
presence_penalty=presence_penalty,
frequency_penalty=frequency_penalty,
response_format=response_format,
extra_body={
"top_k": top_k,
"repetition_penalty": repetition_penalty,
"min_p": min_p
}
)
if stream:
for chunk in chat_completion_res:
print(chunk.choices[0].delta.content or "", end="")
else:
print(chat_completion_res.choices[0].message.content)
Usar Gemma 3 27B mediante Chatbox
Paso 1: Instala Chatbox

- Selecciona la opción “Setting” (Configuración). Esta configuración garantiza la compatibilidad con APIs que siguen el estándar de la API de OpenAI, como Novita AI.
- Completa los campos de configuración:
- Base URL: Introduce
https://api.novita.ai/v3/openai. - API Key: Pega aquí tu clave de API de Novita AI.
- Model Name: Pega el nombre del modelo que copiaste antes (p. ej.,
google/gemma-3-27b-it).
- Base URL: Introduce
- Una vez completada la configuración, haz clic en Done (Listo).
Usar Gemma 3 27B mediante GPU en la nube
Paso 1: Regístrate
Si eres nuevo en Novita AI, comienza creando una cuenta en nuestro sitio web. Una vez registrado, dirígete a la pestaña “GPUs” para explorar los recursos disponibles y comenzar tu viaje.

Paso 2: Explora plantillas y servidores GPU
Comienza seleccionando una plantilla que se adapte a las necesidades de tu proyecto, como PyTorch, TensorFlow o CUDA. Elige la versión que se ajuste a tus requisitos, por ejemplo PyTorch 2.2.1 o CUDA 11.8.0. Luego, selecciona la configuración del servidor GPU A100, que ofrece un rendimiento potente para manejar cargas de trabajo exigentes con amplia VRAM, RAM y capacidad de disco.

Prueba las GPU de alto rendimiento de Novita AI
Paso 3: Personaliza tu implementación
Después de seleccionar una plantilla y GPU, personaliza los ajustes de implementación ajustando parámetros como la versión del sistema operativo (p. ej., CUDA 11.8). También puedes modificar otras configuraciones para adaptar el entorno a los requisitos específicos de tu proyecto.

Paso 4: Lanza una instancia
Una vez que hayas finalizado la plantilla y los ajustes de implementación, haz clic en “Launch Instance” (Lanzar instancia) para configurar tu instancia GPU. Esto iniciará la preparación del entorno, permitiéndote comenzar a usar los recursos GPU para tus tareas de IA.

Con sólidos benchmarks y opciones de implementación simples, Gemma 3 27B es una opción destacada para desarrolladores e investigadores que buscan herramientas de IA abiertas y de alta calidad.
Preguntas frecuentes
¿Qué es Gemma 3 27B?
Gemma 3 27B es un modelo de lenguaje grande de código abierto con 27 mil millones de parámetros desarrollado por Google. Admite entrada multimodal (texto e imagen), más de 140 idiomas y cuenta con una ventana de contexto de 128K tokens.
¿Cuáles son los requisitos de hardware para ejecutar Gemma 3 27B localmente?
Necesitarás aproximadamente 80 GB de VRAM. Una única NVIDIA H100 es suficiente. También puedes ejecutarlo con varias RTX 4090 (por ejemplo, 3×24 GB).
¿Hay una versión API de Gemma 3 27B disponible?
¡Sí! Puedes acceder a Gemma 3 27B a través de la API de Novita AI, que es totalmente compatible con el estándar de la API de OpenAI.
Novita AI es una plataforma en la nube de IA que ofrece a los desarrolladores una forma sencilla de implementar modelos de IA mediante nuestra API simple, al mismo tiempo que proporciona una GPU en la nube asequible y confiable para construir y escalar.
Lectura recomendada
- Por qué los requisitos de VRAM de LLaMA 3.3 70B son un desafío para servidores domésticos
- Qwen 2.5 72b vs Llama 3.3 70b: ¿Qué modelo se adapta mejor a tus necesidades?
- Qwen 2.5 vs Llama 3.2 90B: Un análisis comparativo de las capacidades de codificación y razonamiento con imágenes
APIs simples y GPU escalable
Novita AI es una plataforma en la nube de IA que ofrece a los desarrolladores una forma sencilla de implementar modelos de IA mediante nuestra API simple, al mismo tiempo que proporciona una GPU en la nube asequible y confiable para construir y escalar.

De