Destaques Principais
O Gemma 3 27B é um LLM multimodal de código aberto lançado pelo Google em março de 2025.
Suporta mais de 140 idiomas com um novo tokenizador e janela de contexto de 128K.
Processa entrada de texto e imagem, gerando texto.
Treinado em 14 trilhões de tokens, destaca-se em matemática, código e seguir instruções.
Pontuações em benchmarks: 1339 Elo, 69.0 (MATH), 67.5 (MMLU-Pro).
Pode ser executado em uma única NVIDIA H100 ou implantado via Ollama (local) ou API / GPU em Nuvem Novita AI.
O Gemma 3 27B é um LLM poderoso e flexível construído pelo Google. Ele combina alcance multilíngue, entrada multimodal e alto desempenho, tornando-o ideal para diversas cargas de trabalho de IA — localmente ou na nuvem.
O que é o Gemma 3 27B?
Características Notáveis
- Suporte Multilíngue Avançado: Com seu novo tokenizador, o Gemma 3 é altamente eficaz em mais de 140 idiomas.
- Entrada Multimodal: A capacidade de processar imagens e texto o torna uma ferramenta versátil para uma variedade de aplicações.
- Janela de Contexto Estendida: A capacidade de 128K tokens permite lidar com entradas extensas e detalhadas.
- Código Aberto e Amigável para a Comunidade: Por ser de código aberto, o modelo incentiva a experimentação e ampla adoção pela comunidade.
| Categoria | Item | Detalhes |
|---|---|---|
| Informações Básicas | Data de Lançamento | 12 de março de 2025 |
| Tamanho do Modelo | 27 bilhões de parâmetros | |
| Código Aberto | Sim (lançado pelo Google) | |
| Suporte a Idiomas | Idiomas Multilíngues Suportados | Mais de 140 idiomas |
| Treinamento | Dados de Treinamento | 14 trilhões de tokens |
| Pontos Fortes | Matemática, programação, seguir instruções | |
| Multimodal | Capacidade Multimodal | Sim (processa imagens e texto, gera texto) |
| Contexto | Janela de Contexto | 128K tokens |
| Tamanho do Modelo por Precisão | bf16 (Cru) | Pesos: 54,0 GB; Pesos + Cache KV: 72,7 GB |
| INT4 | Pesos: 14,1 GB; Pesos + Cache KV: 32,8 GB | |
| INT4 (blocos=32) | Pesos: 15,3 GB; Pesos + Cache KV: 34,0 GB | |
| SFP8 | Pesos: 27,4 GB; Pesos + Cache KV: 46,1 GB |
Benchmark do Gemma 3 27B
| Benchmark | Gemma 3 27B | DeepSeek R1 | LLaMA 3.3 70B |
|---|---|---|---|
| Pontuação Elo LMSys | 1339 | ~1360 | ~1260 |
| MMLU-Pro | 67,5 | 84,0 | 66,4 |
| LiveCodeBench | 29,7 | 65,9 | ~29 |
| GPQA Diamond | 42,4 | 71,5 | 50,5 |
| MATH | 69,0 | 97,3 | 77,0 |
Como Acessar o Gemma 3 27B Localmente?
Requisitos de Hardware
O Gemma 3 27B é descrito como o "modelo mais capaz que você pode executar em uma única GPU!
Fonte: Google
| Configuração | Requisito de VRAM | Observações |
|---|---|---|
| Implantação em Nuvem | Cerca de 80GB VRAM (GPU única ou múltiplas) | GPUs A100 ou H100 são recomendadas para desempenho ideal em implantação em nuvem. Ou RTX 4090 24GB (x3) |
| Apple Silicon | Gemma 3 4B suportado via mlx-vlm | O Gemma 3 4B é lançado com suporte desde o primeiro dia no mlx-vlm, uma biblioteca de código aberto para executar modelos de visão-linguagem em dispositivos Apple Silicon, incluindo Macs e iPhones. |
Processo passo a passo para instalar o Gemma 3 27B localmente
# Passo 0: Verificar GPU NVIDIA
nvidia-smi
# Passo 1: Atualizar fontes de pacotes do Ubuntu
apt update
# Passo 2: Instalar dependências do Ollama para detecção de GPU
apt install pciutils lshw
# Passo 3: Instalar o Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Passo 4: Iniciar o servidor Ollama (execute em um terminal e mantenha aberto)
ollama serve
# Passo 5: (Em um novo terminal) Verificar se o Ollama está funcionando
ollama
# Passo 6: Instalar modelos Gemma-3 (escolha um)
# Executar Gemma-3 1B
# ollama run gemma3:1b
# Executar Gemma-3 4B
# ollama run gemma3:4b
# Executar Gemma-3 12B
# ollama run gemma3:12b
# ✅ Recomendado: Executar Gemma-3 27B
ollama run gemma3:27b
# Passo 7: Interagir com o modelo diretamente via prompt no console
# Exemplo:
# Você é um analista de trading baseado em IA especializado em mercados de criptomoedas.
# Sua tarefa é projetar um agente de IA autônomo que possa prever tendências de mercado,
# executar trades e gerenciar riscos de forma eficiente. Sua resposta deve incluir:
# - Uma estratégia para analisar dados on-chain + off-chain
# - Escolha de modelo para previsão de preços e sentimento
# - Um trecho de código Python
# - Métodos de gerenciamento de riscos
# - Preocupações éticas
Como Acessar o Gemma 3 27B via API Novita?
Passo 1: Fazer Login e Acessar a Biblioteca de Modelos
Faça login na sua conta e clique no botão Biblioteca de Modelos.

Experimente o Gemma 3 27B Demo Agora!
Passo 2: Iniciar seu Teste Gratuito
Inicie seu teste gratuito para explorar as capacidades do modelo selecionado.

Passo 3: Obter sua Chave de API
Para autenticar com a API, forneceremos uma nova chave de API. Entrando na página “Configurações”, você pode copiar a chave de API conforme indicado na imagem.

Passo 4: Instalar a API
Instale a API usando o gerenciador de pacotes específico da sua linguagem de programação.

Após a instalação, importe as bibliotecas necessárias para o seu ambiente de desenvolvimento. Inicialize a API com sua chave de API para começar a interagir com o Novita AI LLM. Este é um exemplo de uso da API de conclusões de chat para usuários Python.
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="<SUA CHAVE DE API Novita AI>",
)
model = "google/gemma-3-27b-it"
stream = True # or False
max_tokens = 2048
system_content = """Seja um assistente útil"""
temperature = 1
top_p = 1
min_p = 0
top_k = 50
presence_penalty = 0
frequency_penalty = 0
repetition_penalty = 1
response_format = { "type": "text" }
chat_completion_res = client.chat.completions.create(
model=model,
messages=[
{
"role": "system",
"content": system_content,
},
{
"role": "user",
"content": "Olá!",
}
],
stream=stream,
max_tokens=max_tokens,
temperature=temperature,
top_p=top_p,
presence_penalty=presence_penalty,
frequency_penalty=frequency_penalty,
response_format=response_format,
extra_body={
"top_k": top_k,
"repetition_penalty": repetition_penalty,
"min_p": min_p
}
)
if stream:
for chunk in chat_completion_res:
print(chunk.choices[0].delta.content or "", end="")
else:
print(chat_completion_res.choices[0].message.content)
Usando o Gemma 3 27B via Chatbox
Passo 1: Instalar o Chatbox

- Selecione a opção “Configuração”. Essa configuração garante compatibilidade com APIs que seguem o padrão OpenAI API, como a Novita AI.
- Preencha os campos de configuração:
- URL Base: Insira
https://api.novita.ai/v3/openai. - Chave de API: Cole sua chave de API Novita AI aqui.
- Nome do Modelo: Cole o nome do modelo que você copiou anteriormente (por exemplo,
google/gemma-3-27b-it).
- URL Base: Insira
- Após preencher a configuração, clique em Concluído.
Usando o Gemma 3 27B via GPU em Nuvem
Passo 1: Registrar uma conta
Se você é novo na Novita AI, comece criando uma conta em nosso site. Depois de registrado, vá para a aba “GPUs” para explorar os recursos disponíveis e iniciar sua jornada.

Passo 2: Explorar Modelos e Servidores GPU
Comece selecionando um modelo que atenda às necessidades do seu projeto, como PyTorch, TensorFlow ou CUDA. Escolha a versão que se adequa aos seus requisitos, como PyTorch 2.2.1 ou CUDA 11.8.0. Em seguida, selecione a configuração do servidor GPU A100, que oferece desempenho poderoso para lidar com cargas de trabalho exigentes, com ampla VRAM, RAM e capacidade de disco.

Experimente as GPUs de Alto Desempenho da Novita AI
Passo 3: Personalizar sua Implantação
Após selecionar um modelo e GPU, personalize suas configurações de implantação ajustando parâmetros como a versão do sistema operacional (por exemplo, CUDA 11.8). Você também pode ajustar outras configurações para adaptar o ambiente aos requisitos específicos do seu projeto.

Passo 4: Iniciar uma instância
Depois de finalizar o modelo e as configurações de implantação, clique em “Iniciar Instância” para configurar sua instância GPU. Isso iniciará a configuração do ambiente, permitindo que você comece a usar os recursos da GPU para suas tarefas de IA.

Com benchmarks sólidos e opções de implantação simples, o Gemma 3 27B é uma excelente escolha para desenvolvedores e pesquisadores que buscam ferramentas de IA abertas e de alta qualidade.
Perguntas Frequentes
O que é o Gemma 3 27B?
Gemma 3 27B é um modelo de linguagem grande de código aberto com 27 bilhões de parâmetros desenvolvido pelo Google. Suporta entrada multimodal (texto + imagem), mais de 140 idiomas e possui uma janela de contexto de 128K tokens.
Quais são os requisitos de hardware para executar o Gemma 3 27B localmente?
Você precisará de aproximadamente 80GB de VRAM. Uma única NVIDIA H100 é suficiente. Você também pode executá-lo com múltiplas RTX 4090 (por exemplo, 3×24GB).
Existe uma versão via API do Gemma 3 27B disponível?
Sim! Você pode acessar o Gemma 3 27B através da API Novita AI, que é totalmente compatível com o padrão OpenAI API.
Novita AI é uma plataforma de nuvem de IA que oferece aos desenvolvedores uma maneira fácil de implantar modelos de IA usando nossa API simples, além de fornecer uma GPU em nuvem acessível e confiável para construir e escalar.
Leitura Recomendada
- Por que os Requisitos de VRAM do LLaMA 3.3 70B São um Desafio para Servidores Domésticos?
- Qwen 2.5 72b vs Llama 3.3 70b: Qual Modelo Atende às Suas Necessidades?
- Qwen 2.5 vs Llama 3.2 90B: Uma Análise Comparativa das Capacidades de Programação e Raciocínio com Imagens
APIs Simples e GPU Escalável
A Novita AI é uma plataforma de nuvem de IA que oferece aos desenvolvedores uma maneira fácil de implantar modelos de IA usando nossa API simples, além de fornecer uma GPU em nuvem acessível e confiável para construir e escalar.

Fonte: