Como Acessar o Gemma 3 27B Localmente, via API, na GPU em Nuvem

Como Acessar o Gemma 3 27B Localmente, via API, na GPU em Nuvem

Destaques Principais

O Gemma 3 27B é um LLM multimodal de código aberto lançado pelo Google em março de 2025.

Suporta mais de 140 idiomas com um novo tokenizador e janela de contexto de 128K.

Processa entrada de texto e imagem, gerando texto.

Treinado em 14 trilhões de tokens, destaca-se em matemática, código e seguir instruções.

Pontuações em benchmarks: 1339 Elo, 69.0 (MATH), 67.5 (MMLU-Pro).

Pode ser executado em uma única NVIDIA H100 ou implantado via Ollama (local) ou API / GPU em Nuvem Novita AI.

O Gemma 3 27B é um LLM poderoso e flexível construído pelo Google. Ele combina alcance multilíngue, entrada multimodal e alto desempenho, tornando-o ideal para diversas cargas de trabalho de IA — localmente ou na nuvem.

O que é o Gemma 3 27B?

Características Notáveis

  • Suporte Multilíngue Avançado: Com seu novo tokenizador, o Gemma 3 é altamente eficaz em mais de 140 idiomas.
  • Entrada Multimodal: A capacidade de processar imagens e texto o torna uma ferramenta versátil para uma variedade de aplicações.
  • Janela de Contexto Estendida: A capacidade de 128K tokens permite lidar com entradas extensas e detalhadas.
  • Código Aberto e Amigável para a Comunidade: Por ser de código aberto, o modelo incentiva a experimentação e ampla adoção pela comunidade.
Categoria Item Detalhes
Informações Básicas Data de Lançamento 12 de março de 2025
Tamanho do Modelo 27 bilhões de parâmetros
Código Aberto Sim (lançado pelo Google)
Suporte a Idiomas Idiomas Multilíngues Suportados Mais de 140 idiomas
Treinamento Dados de Treinamento 14 trilhões de tokens
Pontos Fortes Matemática, programação, seguir instruções
Multimodal Capacidade Multimodal Sim (processa imagens e texto, gera texto)
Contexto Janela de Contexto 128K tokens
Tamanho do Modelo por Precisão bf16 (Cru) Pesos: 54,0 GB; Pesos + Cache KV: 72,7 GB
INT4 Pesos: 14,1 GB; Pesos + Cache KV: 32,8 GB
INT4 (blocos=32) Pesos: 15,3 GB; Pesos + Cache KV: 34,0 GB
SFP8 Pesos: 27,4 GB; Pesos + Cache KV: 46,1 GB

Benchmark do Gemma 3 27B

Benchmark Gemma 3 27B DeepSeek R1 LLaMA 3.3 70B
Pontuação Elo LMSys 1339 ~1360 ~1260
MMLU-Pro 67,5 84,0 66,4
LiveCodeBench 29,7 65,9 ~29
GPQA Diamond 42,4 71,5 50,5
MATH 69,0 97,3 77,0

Como Acessar o Gemma 3 27B Localmente?

Requisitos de Hardware

O Gemma 3 27B é descrito como o "modelo mais capaz que você pode executar em uma única GPU!

PONTUAÇÃO ELO Fonte: Google

Configuração Requisito de VRAM Observações
Implantação em Nuvem Cerca de 80GB VRAM (GPU única ou múltiplas) GPUs A100 ou H100 são recomendadas para desempenho ideal em implantação em nuvem. Ou RTX 4090 24GB (x3)
Apple Silicon Gemma 3 4B suportado via mlx-vlm O Gemma 3 4B é lançado com suporte desde o primeiro dia no mlx-vlm, uma biblioteca de código aberto para executar modelos de visão-linguagem em dispositivos Apple Silicon, incluindo Macs e iPhones.

Processo passo a passo para instalar o Gemma 3 27B localmente

# Passo 0: Verificar GPU NVIDIA
nvidia-smi

# Passo 1: Atualizar fontes de pacotes do Ubuntu
apt update

# Passo 2: Instalar dependências do Ollama para detecção de GPU
apt install pciutils lshw

# Passo 3: Instalar o Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Passo 4: Iniciar o servidor Ollama (execute em um terminal e mantenha aberto)
ollama serve

# Passo 5: (Em um novo terminal) Verificar se o Ollama está funcionando
ollama

# Passo 6: Instalar modelos Gemma-3 (escolha um)

# Executar Gemma-3 1B
# ollama run gemma3:1b

# Executar Gemma-3 4B
# ollama run gemma3:4b

# Executar Gemma-3 12B
# ollama run gemma3:12b

# ✅ Recomendado: Executar Gemma-3 27B
ollama run gemma3:27b

# Passo 7: Interagir com o modelo diretamente via prompt no console
# Exemplo:
# Você é um analista de trading baseado em IA especializado em mercados de criptomoedas.
# Sua tarefa é projetar um agente de IA autônomo que possa prever tendências de mercado,
# executar trades e gerenciar riscos de forma eficiente. Sua resposta deve incluir:
# - Uma estratégia para analisar dados on-chain + off-chain
# - Escolha de modelo para previsão de preços e sentimento
# - Um trecho de código Python
# - Métodos de gerenciamento de riscos
# - Preocupações éticas

Como Acessar o Gemma 3 27B via API Novita?

Passo 1: Fazer Login e Acessar a Biblioteca de Modelos

Faça login na sua conta e clique no botão Biblioteca de Modelos.

Fazer Login e Acessar a Biblioteca de Modelos

Experimente o Gemma 3 27B Demo Agora!

Passo 2: Iniciar seu Teste Gratuito

Inicie seu teste gratuito para explorar as capacidades do modelo selecionado.

iniciar um teste gratuito no gemma 3

Passo 3: Obter sua Chave de API

Para autenticar com a API, forneceremos uma nova chave de API. Entrando na página “Configurações”, você pode copiar a chave de API conforme indicado na imagem.

obter chave de api

Passo 4: Instalar a API

Instale a API usando o gerenciador de pacotes específico da sua linguagem de programação.

instalar api no gemma 3

Após a instalação, importe as bibliotecas necessárias para o seu ambiente de desenvolvimento. Inicialize a API com sua chave de API para começar a interagir com o Novita AI LLM. Este é um exemplo de uso da API de conclusões de chat para usuários Python.

from openai import OpenAI
  
client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="<SUA CHAVE DE API Novita AI>",
)

model = "google/gemma-3-27b-it"
stream = True # or False
max_tokens = 2048
system_content = """Seja um assistente útil"""
temperature = 1
top_p = 1
min_p = 0
top_k = 50
presence_penalty = 0
frequency_penalty = 0
repetition_penalty = 1
response_format = { "type": "text" }

chat_completion_res = client.chat.completions.create(
    model=model,
    messages=[
        {
            "role": "system",
            "content": system_content,
        },
        {
            "role": "user",
            "content": "Olá!",
        }
    ],
    stream=stream,
    max_tokens=max_tokens,
    temperature=temperature,
    top_p=top_p,
    presence_penalty=presence_penalty,
    frequency_penalty=frequency_penalty,
    response_format=response_format,
    extra_body={
      "top_k": top_k,
      "repetition_penalty": repetition_penalty,
      "min_p": min_p
    }
  )

if stream:
    for chunk in chat_completion_res:
        print(chunk.choices[0].delta.content or "", end="")
else:
    print(chat_completion_res.choices[0].message.content)

Usando o Gemma 3 27B via Chatbox

Passo 1: Instalar o Chatbox

Usando o Gemma 3 27B via Chatbox

  1. Selecione a opção “Configuração”. Essa configuração garante compatibilidade com APIs que seguem o padrão OpenAI API, como a Novita AI.
  2. Preencha os campos de configuração:
    • URL Base: Insira https://api.novita.ai/v3/openai.
    • Chave de API: Cole sua chave de API Novita AI aqui.
    • Nome do Modelo: Cole o nome do modelo que você copiou anteriormente (por exemplo, google/gemma-3-27b-it).
  3. Após preencher a configuração, clique em Concluído.

Usando o Gemma 3 27B via GPU em Nuvem

Passo 1: Registrar uma conta

Se você é novo na Novita AI, comece criando uma conta em nosso site. Depois de registrado, vá para a aba “GPUs” para explorar os recursos disponíveis e iniciar sua jornada.

Captura de tela do site Novita AI

Passo 2: Explorar Modelos e Servidores GPU

Comece selecionando um modelo que atenda às necessidades do seu projeto, como PyTorch, TensorFlow ou CUDA. Escolha a versão que se adequa aos seus requisitos, como PyTorch 2.2.1 ou CUDA 11.8.0. Em seguida, selecione a configuração do servidor GPU A100, que oferece desempenho poderoso para lidar com cargas de trabalho exigentes, com ampla VRAM, RAM e capacidade de disco.

captura de tela do site novita ai usando gpu em nuvem

Experimente as GPUs de Alto Desempenho da Novita AI

Passo 3: Personalizar sua Implantação

Após selecionar um modelo e GPU, personalize suas configurações de implantação ajustando parâmetros como a versão do sistema operacional (por exemplo, CUDA 11.8). Você também pode ajustar outras configurações para adaptar o ambiente aos requisitos específicos do seu projeto.

captura de tela do site novita ai usando gpu em nuvem

Passo 4: Iniciar uma instância

Depois de finalizar o modelo e as configurações de implantação, clique em “Iniciar Instância” para configurar sua instância GPU. Isso iniciará a configuração do ambiente, permitindo que você comece a usar os recursos da GPU para suas tarefas de IA.

captura de tela do site novita ai usando gpu em nuvem

Com benchmarks sólidos e opções de implantação simples, o Gemma 3 27B é uma excelente escolha para desenvolvedores e pesquisadores que buscam ferramentas de IA abertas e de alta qualidade.

Perguntas Frequentes

O que é o Gemma 3 27B?

Gemma 3 27B é um modelo de linguagem grande de código aberto com 27 bilhões de parâmetros desenvolvido pelo Google. Suporta entrada multimodal (texto + imagem), mais de 140 idiomas e possui uma janela de contexto de 128K tokens.

Quais são os requisitos de hardware para executar o Gemma 3 27B localmente?

Você precisará de aproximadamente 80GB de VRAM. Uma única NVIDIA H100 é suficiente. Você também pode executá-lo com múltiplas RTX 4090 (por exemplo, 3×24GB).

Existe uma versão via API do Gemma 3 27B disponível?

Sim! Você pode acessar o Gemma 3 27B através da API Novita AI, que é totalmente compatível com o padrão OpenAI API.

Novita AI é uma plataforma de nuvem de IA que oferece aos desenvolvedores uma maneira fácil de implantar modelos de IA usando nossa API simples, além de fornecer uma GPU em nuvem acessível e confiável para construir e escalar.

Leitura Recomendada

APIs Simples e GPU Escalável

A Novita AI é uma plataforma de nuvem de IA que oferece aos desenvolvedores uma maneira fácil de implantar modelos de IA usando nossa API simples, além de fornecer uma GPU em nuvem acessível e confiável para construir e escalar.

Experimente o Gemma 3 27B Demo Agora