Cómo acceder a Gemma 3 27B localmente, mediante API y en GPU en la nube

Cómo acceder a Gemma 3 27B localmente, mediante API y en GPU en la nube

Aspectos destacados

Gemma 3 27B es un LLM multimodal de código abierto lanzado por Google en marzo de 2025.

Admite más de 140 idiomas con un nuevo tokenizador y una ventana de contexto de 128K.

Procesa entrada de texto e imagen y genera texto.

Entrenado con 14 billones de tokens, destaca en matemáticas, código y seguimiento de instrucciones.

Puntuaciones en benchmarks: 1339 Elo, 69.0 (MATH), 67.5 (MMLU-Pro).

Puede ejecutarse en una única NVIDIA H100 o desplegarse mediante Ollama (local) o API / GPU en la nube de Novita AI.

Gemma 3 27B es un LLM potente y flexible creado por Google. Combina alcance multilingüe, entrada multimodal y alto rendimiento, lo que lo hace ideal para diversas cargas de trabajo de IA, tanto local como en la nube.

¿Qué es Gemma 3 27B?

Características destacadas

  • Soporte multilingüe avanzado: Con su nuevo tokenizador, Gemma 3 es muy eficaz en más de 140 idiomas.
  • Entrada multimodal: La capacidad de procesar tanto imágenes como texto lo convierte en una herramienta versátil para diversas aplicaciones.
  • Ventana de contexto extendida: La capacidad de 128K tokens permite manejar entradas extensas y detalladas.
  • Código abierto y amigable con la comunidad: Al ser de código abierto, el modelo fomenta la experimentación comunitaria y una adopción amplia.
Categoría Elemento Detalles
Información básica Fecha de lanzamiento 12 de marzo de 2025
Tamaño del modelo 27 mil millones de parámetros
Código abierto Sí (publicado por Google)
Soporte de idiomas Idiomas multilingües admitidos Más de 140 idiomas
Entrenamiento Datos de entrenamiento 14 billones de tokens
Fortalezas Matemáticas, programación, seguimiento de instrucciones
Multimodal Capacidad multimodal Sí (procesa imágenes y texto, genera texto)
Contexto Ventana de contexto 128K tokens
Tamaño del modelo por precisión bf16 (sin comprimir) Pesos: 54.0 GB; Pesos + caché KV: 72.7 GB
INT4 Pesos: 14.1 GB; Pesos + caché KV: 32.8 GB
INT4 (bloques=32) Pesos: 15.3 GB; Pesos + caché KV: 34.0 GB
SFP8 Pesos: 27.4 GB; Pesos + caché KV: 46.1 GB

Benchmarks de Gemma 3 27B

Benchmark Gemma 3 27B DeepSeek R1 LLaMA 3.3 70B
Puntuación LMSys Elo 1339 ~1360 ~1260
MMLU-Pro 67.5 84.0 66.4
LiveCodeBench 29.7 65.9 ~29
GPQA Diamond 42.4 71.5 50.5
MATH 69.0 97.3 77.0

¿Cómo acceder a Gemma 3 27B localmente?

Requisitos de hardware

Gemma 3 27B está descrito como el “modelo más potente que se puede ejecutar en una sola GPU”.

Puntuación ELO De Google

Configuración Requisito de VRAM Notas
Implementación en la nube Aproximadamente 80 GB de VRAM (una o varias GPU) Se recomiendan GPU A100 o H100 para un rendimiento óptimo en la nube. También RTX 4090 24 GB (x3)
Apple Silicon Gemma 3 4B compatible mediante mlx-vlm Gemma 3 4B se lanza con soporte desde el día cero en mlx-vlm, una biblioteca de código abierto para ejecutar modelos de visión y lenguaje en dispositivos Apple Silicon, incluidos Macs y iPhones.

Proceso paso a paso para instalar Gemma 3 27B localmente

# Step 0: Check NVIDIA GPU
nvidia-smi

# Step 1: Update Ubuntu package sources
apt update

# Step 2: Install Ollama dependencies for GPU detection
apt install pciutils lshw

# Step 3: Install Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Step 4: Start Ollama server (run this in one terminal and keep it open)
ollama serve

# Step 5: (In a new terminal) Check if Ollama is working
ollama

# Step 6: Install Gemma-3 models (choose one)

# Run Gemma-3 1B
# ollama run gemma3:1b

# Run Gemma-3 4B
# ollama run gemma3:4b

# Run Gemma-3 12B
# ollama run gemma3:12b

# ✅ Recommended: Run Gemma-3 27B
ollama run gemma3:27b

# Step 7: Interact with the model directly via prompt in the console
# Example:
# You are an AI-powered trading analyst specializing in cryptocurrency markets.
# Your task is to design an autonomous AI agent that can predict market trends,
# execute trades, and manage risks efficiently. Your response should include:
# - A strategy for analyzing on-chain + off-chain data
# - Model choice for price prediction and sentiment
# - A Python code snippet
# - Risk management methods
# - Ethical concerns

¿Cómo acceder a Gemma 3 27B mediante la API de Novita?

Paso 1: Inicia sesión y accede a la biblioteca de modelos

Inicia sesión en tu cuenta y haz clic en el botón Model Library (Biblioteca de modelos).

Inicia sesión y accede a la biblioteca de modelos

¡Prueba Gemma 3 27B Demo ahora!

Paso 2: Comienza tu prueba gratuita

Inicia tu prueba gratuita para explorar las capacidades del modelo seleccionado.

comienza una prueba gratuita en gemma 3

Paso 3: Obtén tu clave de API

Para autenticarte en la API, te proporcionaremos una nueva clave de API. Ingresa a la página “Settings” (Configuración) y copia la clave de API como se indica en la imagen.

obtén la clave de API

Paso 4: Instala la API

Instala la API usando el gestor de paquetes específico de tu lenguaje de programación.

instala la API en gemma 3

Después de la instalación, importa las bibliotecas necesarias en tu entorno de desarrollo. Inicializa la API con tu clave de API para comenzar a interactuar con Novita AI LLM. Este es un ejemplo de uso de la API de completaciones de chat para usuarios de Python.

from openai import OpenAI
  
client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="<TU Clave de API de Novita AI>",
)

model = "google/gemma-3-27b-it"
stream = True # or False
max_tokens = 2048
system_content = """Be a helpful assistant"""
temperature = 1
top_p = 1
min_p = 0
top_k = 50
presence_penalty = 0
frequency_penalty = 0
repetition_penalty = 1
response_format = { "type": "text" }

chat_completion_res = client.chat.completions.create(
    model=model,
    messages=[
        {
            "role": "system",
            "content": system_content,
        },
        {
            "role": "user",
            "content": "Hi there!",
        }
    ],
    stream=stream,
    max_tokens=max_tokens,
    temperature=temperature,
    top_p=top_p,
    presence_penalty=presence_penalty,
    frequency_penalty=frequency_penalty,
    response_format=response_format,
    extra_body={
      "top_k": top_k,
      "repetition_penalty": repetition_penalty,
      "min_p": min_p
    }
  )

if stream:
    for chunk in chat_completion_res:
        print(chunk.choices[0].delta.content or "", end="")
else:
    print(chat_completion_res.choices[0].message.content)

Usar Gemma 3 27B mediante Chatbox

Paso 1: Instala Chatbox

Usar Gemma 3 27B mediante Chatbox

  1. Selecciona la opción “Setting” (Configuración). Esta configuración garantiza la compatibilidad con APIs que siguen el estándar de la API de OpenAI, como Novita AI.
  2. Completa los campos de configuración:
    • Base URL: Introduce https://api.novita.ai/v3/openai.
    • API Key: Pega aquí tu clave de API de Novita AI.
    • Model Name: Pega el nombre del modelo que copiaste antes (p. ej., google/gemma-3-27b-it).
  3. Una vez completada la configuración, haz clic en Done (Listo).

Usar Gemma 3 27B mediante GPU en la nube

Paso 1: Regístrate

Si eres nuevo en Novita AI, comienza creando una cuenta en nuestro sitio web. Una vez registrado, dirígete a la pestaña “GPUs” para explorar los recursos disponibles y comenzar tu viaje.

Captura de pantalla del sitio web de Novita AI

Paso 2: Explora plantillas y servidores GPU

Comienza seleccionando una plantilla que se adapte a las necesidades de tu proyecto, como PyTorch, TensorFlow o CUDA. Elige la versión que se ajuste a tus requisitos, por ejemplo PyTorch 2.2.1 o CUDA 11.8.0. Luego, selecciona la configuración del servidor GPU A100, que ofrece un rendimiento potente para manejar cargas de trabajo exigentes con amplia VRAM, RAM y capacidad de disco.

captura de pantalla del sitio web de novita ai usando gpu en la nube

Prueba las GPU de alto rendimiento de Novita AI

Paso 3: Personaliza tu implementación

Después de seleccionar una plantilla y GPU, personaliza los ajustes de implementación ajustando parámetros como la versión del sistema operativo (p. ej., CUDA 11.8). También puedes modificar otras configuraciones para adaptar el entorno a los requisitos específicos de tu proyecto.

captura de pantalla del sitio web de novita ai usando gpu en la nube

Paso 4: Lanza una instancia

Una vez que hayas finalizado la plantilla y los ajustes de implementación, haz clic en “Launch Instance” (Lanzar instancia) para configurar tu instancia GPU. Esto iniciará la preparación del entorno, permitiéndote comenzar a usar los recursos GPU para tus tareas de IA.

captura de pantalla del sitio web de novita ai usando gpu en la nube

Con sólidos benchmarks y opciones de implementación simples, Gemma 3 27B es una opción destacada para desarrolladores e investigadores que buscan herramientas de IA abiertas y de alta calidad.

Preguntas frecuentes

¿Qué es Gemma 3 27B?

Gemma 3 27B es un modelo de lenguaje grande de código abierto con 27 mil millones de parámetros desarrollado por Google. Admite entrada multimodal (texto e imagen), más de 140 idiomas y cuenta con una ventana de contexto de 128K tokens.

¿Cuáles son los requisitos de hardware para ejecutar Gemma 3 27B localmente?

Necesitarás aproximadamente 80 GB de VRAM. Una única NVIDIA H100 es suficiente. También puedes ejecutarlo con varias RTX 4090 (por ejemplo, 3×24 GB).

¿Hay una versión API de Gemma 3 27B disponible?

¡Sí! Puedes acceder a Gemma 3 27B a través de la API de Novita AI, que es totalmente compatible con el estándar de la API de OpenAI.

Novita AI es una plataforma en la nube de IA que ofrece a los desarrolladores una forma sencilla de implementar modelos de IA mediante nuestra API simple, al mismo tiempo que proporciona una GPU en la nube asequible y confiable para construir y escalar.

Lectura recomendada

APIs simples y GPU escalable

Novita AI es una plataforma en la nube de IA que ofrece a los desarrolladores una forma sencilla de implementar modelos de IA mediante nuestra API simple, al mismo tiempo que proporciona una GPU en la nube asequible y confiable para construir y escalar.

Prueba Gemma 3 27B Demo ahora