Kling O1 no Novita AI: modos T2V, I2V, Ref2V e Video Edit

Kling O1 no Novita AI: modos T2V, I2V, Ref2V e Video Edit

O Kling O1 (Kling Omni Video O1) é o primeiro modelo de vídeo multimodal unificado da Kuaishou, expondo quatro modos de geração distintos por meio da API da Novita AI: Text-to-Video (T2V), Image-to-Video (I2V), Reference-to-Video (Ref2V) e Video Edit. Cada modo aceita entradas diferentes e resolve um problema diferente — escolher o errado adiciona atrito e custo. Este guia explica o que cada modo realmente faz, o que ele exige, como é precificado no Novita AI e qual experimentar primeiro para casos de uso comuns de desenvolvedores.

O que é o Kling O1?

O Kling O1 é construído sobre a arquitetura MVL (Multimodal Visual Language) da Kuaishou, que consolida tarefas de texto, imagem, referência e edição de vídeo em um único modelo, em vez de direcioná-las para modelos especializados separados. Isso importa na prática: o modelo de movimento subjacente e a codificação de identidade são compartilhados entre os modos, de modo que personagens e objetos descritos em um modo carregam propriedades visuais consistentes para o próximo.

Em comparação com versões anteriores do Kling (V2.5, V2.6, V3.0 Standard/Pro), o Kling O1 adiciona capacidades de Ref2V e Video Edit que são estruturalmente novas — elas não estavam disponíveis em nenhum nível Standard ou Pro antes do O1. T2V e I2V no O1 ganham a espinha dorsal MVL compartilhada, o que melhora a consistência do assunto entre os quadros em comparação com os modelos de geração anteriores.

O Kling O1 é distinto do Kling 3.0 (também chamado de Kling O3). O Kling 3.0 é um modelo sucessor que adiciona co-geração de áudio nativo e clipes estendidos de 15 segundos. O Kling O1 no Novita AI atualmente cobre vídeos de até 10 segundos sem áudio nativo.

Os Quatro Modos em Resumo

Modo Entrada Principal Entradas Obrigatórias Duração Preço no Novita AI
T2V Prompt de texto prompt 5–10 s $0.112/s
I2V Imagem + prompt image_url, prompt 5–10 s $0.112/s
Ref2V Imagens de referência + prompt prompt, image_urls ou elements 3–10 s $0.168/s
Video Edit Vídeo de origem + prompt video_url, prompt 3–10 s (Fast: 6–20 s) $0.168/s (Fast: $0.09/s)

Preços verificados nas páginas de modelos do Novita AI em 2026-06-26. A cobrança por segundo se aplica à duração que você especificar.

Kling O1 Text-to-Video (T2V) no Novita AI

Endpoint: POST /v3/async/kling-o1-t2v

O T2V gera um vídeo inteiramente a partir de uma descrição em texto. Você fornece um prompt; o modelo cria movimento, iluminação, movimentação de câmera e composição de cena do zero. Não há uma âncora de imagem, então o modelo tem latitude criativa total dentro das restrições do prompt.

Use T2V quando:

  • Você não tem uma imagem de referência ou quadro de cena.
  • Você está explorando um conceito antes de se comprometer com uma direção visual.
  • Você precisa gerar muitas variações visuais com baixo custo por clipe.

A $0.112/s, um clipe de 5 segundos custa $0.56 e um clipe de 10 segundos custa $1.12. O T2V suporta durações de 5 e 10 segundos no Novita AI com proporções de aspecto 16:9, 9:16 e 1:1.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "A red fox trotting through a snowy pine forest, golden hour light, cinematic wide shot",
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

Kling O1 Image-to-Video (I2V) no Novita AI

Endpoint: POST /v3/async/kling-o1-i2v

O I2V anima uma imagem estática em um clipe de vídeo. A imagem de origem se torna o quadro inicial; o prompt controla o movimento e o desenvolvimento de cena que se seguem. Você pode opcionalmente fornecer um quadro final para dar ao modelo um estado alvo, e o modelo interpola o movimento entre o início e o fim.

Obrigatórios: image_url (quadro inicial) e prompt. O quadro final (end_image_url) é opcional, mas útil quando você quer uma composição específica no ponto de corte.

Use I2V quando:

  • Você tem uma imagem ou design existente que precisa se mover.
  • Você quer um ancoramento visual determinístico — a aparência do personagem ou da cena já está definida na imagem de origem.
  • Você está criando demos de produtos, conteúdo para redes sociais ou animações de e-commerce a partir de ativos existentes.

A $0.112/s, o I2V custa o mesmo que o T2V. A principal compensação é que o I2V fixa o quadro de abertura à sua imagem de entrada, o que melhora a consistência, mas também significa que uma imagem de origem de baixa qualidade limita a saída. Restrições de imagem no Novita AI: mínimo de 300×300px, tamanho máximo de arquivo de 10MB, proporção de aspecto entre 0.4 e 2.5.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-i2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "image_url": "https://example.com/product-shot.jpg",
    "prompt": "The product slowly rotates to reveal the back panel, soft studio lighting",
    "duration": 5,
    "aspect_ratio": "1:1"
  }'

Kling O1 Reference-to-Video (Ref2V) no Novita AI

Endpoint: POST /v3/async/kling-o1-ref2v

O Ref2V é o modo mais flexível e o que usa mais diretamente a arquitetura MVL do O1. Em vez de um único quadro inicial, você fornece até sete imagens de referência em dois tipos de entrada: image_urls (referências de estilo ou cena) e elements (âncoras de identidade de personagem ou objeto). O prompt usa tags @Image1, @Image2, @Element1, @Element2 para dizer ao modelo qual referência aplicar e onde.

Isso permite compor uma cena a partir de múltiplos ativos de origem: um personagem de uma foto de retrato, um fundo de uma imagem de local e um adereço de uma imagem de produto — todos referenciados pelo nome no prompt.

Regras de entrada:

  • prompt é obrigatório.
  • image_urls e elements são opcionais, mas pelo menos um deve ser significativo; um prompt puro sem referências funciona, mas se comporta de forma mais próxima ao T2V.
  • O total de referências (elements + image_urls) não deve exceder 7.
  • Cada elemento em elements pode incluir vários reference_image_urls (tomadas de múltiplos ângulos) além de um frontal_image_url opcional para uma correspondência de identidade mais limpa.

Use Ref2V quando:

  • Você precisa de personagens consistentes em vários clipes (conteúdo episódico, sequências de marketing).
  • Você está combinando personagens ou objetos de diferentes imagens de origem em uma única cena.
  • Você quer que o modelo interpole a partir de um quadro inicial enquanto mantém a identidade visual de um conjunto de referências separado.

O Ref2V custa $0.168/s — 50% a mais que T2V e I2V. Para um clipe de 5 segundos, isso dá $0.84; para 10 segundos, $1.68. O preço mais alto reflete a etapa adicional de codificação de referência. Se o seu caso de uso não exigir consistência de identidade entre imagens, o I2V a $0.112/s é suficiente.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-ref2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "Take @Image1 as the start frame. @Element1 walks into the scene and picks up the glowing artifact. Cinematic lighting, steady camera.",
    "image_urls": ["https://example.com/scene-bg.jpg"],
    "elements": [
      {
        "reference_image_urls": ["https://example.com/character-front.jpg", "https://example.com/character-side.jpg"],
        "frontal_image_url": "https://example.com/character-front.jpg"
      }
    ],
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

Modo Video Edit do Kling O1 no Novita AI

Endpoint (standard): POST /v3/async/kling-o1-video-edit

Endpoint (fast): disponível por meio da variante Fast VideoEdit da Novita AI

O Video Edit recebe um vídeo existente como entrada e o transforma usando um prompt em linguagem natural. O modelo preserva a estrutura de movimento original — timing, movimentação de câmera, o arco de ação — enquanto altera assuntos, ambientes ou estilo visual de acordo com o prompt. Você também pode fornecer imagens de referência e âncoras de elementos usando o mesmo sistema de marcação @Image1 / @Element1 do Ref2V.

Obrigatórios: video_url (vídeo de origem, 3–10s, MP4 ou MOV, 720–2160px, máx. 200MB) e prompt.

Duas variantes:

  • Standard VideoEdit: suporta vídeos de origem de 3 a 10 segundos, precificado a $0.168/s.
  • Fast VideoEdit: suporta vídeos de origem de 6 a 20 segundos, precificado a $0.09/s — o menor custo por segundo entre todos os modos do Kling O1 no Novita AI.

Use Video Edit quando:

  • Você tem filmagens que precisam de uma mudança de estilo ou conteúdo sem refilmagem.
  • Você quer substituir um personagem em um vídeo existente mantendo o mesmo movimento.
  • Você precisa transformar um clipe live-action em um estilo animado.

A principal limitação: o vídeo de origem controla o movimento. O Video Edit não pode mudar o que um assunto faz — ele só pode mudar a aparência do assunto e o ambiente que ele ocupa. Para mudanças de movimento, gere novas filmagens com T2V ou I2V.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-video-edit \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "video_url": "https://example.com/source-clip.mp4",
    "prompt": "Transform the setting to a neon-lit cyberpunk alley, keep the character movements exactly as-is",
    "duration": 5
  }'

Preços no Novita AI

Todos os modos do Kling O1 no Novita AI usam cobrança por segundo com base na duração definida no momento da solicitação. Preços verificados em 2026-06-26.

Modo Endpoint Faixa de Duração Preço/s Custo 5s Custo 10s
T2V /v3/async/kling-o1-t2v 5–10 s $0.112 $0.56 $1.12
I2V /v3/async/kling-o1-i2v 5–10 s $0.112 $0.56 $1.12
Ref2V /v3/async/kling-o1-ref2v 3–10 s $0.168 $0.84 $1.68
VideoEdit /v3/async/kling-o1-video-edit 3–10 s $0.168 $0.84 $1.68
VideoEdit Fast (variante Fast da Novita AI) 6–20 s $0.090 $0.90

Novos usuários do Novita AI recebem créditos gratuitos. Consulte a página de preços do Novita AI para tarifas atuais, pois os preços podem mudar.

Com Qual Modo Você Deve Começar?

Comece com T2V se o seu objetivo é explorar conceitos ou se você não tem um ativo de imagem específico. É o ponto de entrada com menos atrito: um parâmetro obrigatório (prompt), sem necessidade de preparação de ativos.

Passe para I2V quando tiver uma imagem que precisa se mover. Imagens de produto, ilustrações de personagens e fundos de cena funcionam bem como quadros iniciais do I2V. Mesmo preço do T2V, com mais controle visual.

Use Ref2V quando a consistência de identidade entre clipes for importante — por exemplo, um personagem recorrente em várias cenas, ou combinar uma pessoa específica com um ambiente específico. Reserve orçamento para o aumento de 50% no preço; ele não é necessário para geração de um único clipe.

Reserve o Video Edit para fluxos de pós-produção em que as filmagens existentes precisam de uma reformulação visual, mas o movimento deve permanecer intacto. A variante Fast a $0.09/s é a opção mais econômica para edições mais longas (6 a 20 segundos) onde a velocidade de geração é menos crítica.

Situação Modo Recomendado
Sem imagem, explorando ideias T2V
Tem uma imagem de produto ou cena, quer movimento I2V
Precisa do mesmo personagem em vários clipes Ref2V
Tem filmagens, quer um visual diferente VideoEdit (standard)
Edição longa (6–20 s), sensível a custo VideoEdit Fast

Como Chamar a API do Kling O1 no Novita AI

Todos os quatro modos do Kling O1 no Novita AI são assíncronos. Cada solicitação retorna um task_id imediatamente; faça polling no endpoint Task Result até que o status seja succeed.

# Step 1: Submit your generation task (example: T2V)
RESPONSE=$(curl --silent --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{"prompt": "Your prompt here", "duration": 5, "aspect_ratio": "16:9"}')

TASK_ID=$(echo $RESPONSE | python3 -c "import sys,json; print(json.load(sys.stdin)['task_id'])")

# Step 2: Poll for results
curl --request GET \
  --url "https://api.novita.ai/v3/async/task-result?task_id=$TASK_ID" \
  --header "Authorization: Bearer $NOVITA_API_KEY"

A resposta inclui um campo status. Quando ele estiver como succeed, o array videos contém a URL de saída. O tempo típico de geração é de 30 a 120 segundos, dependendo da duração e do modo.

Obtenha sua chave de API no painel do Novita AI. Novas contas recebem créditos gratuitos para testar todos os quatro modos antes de se comprometer com volume de produção.

Conclusão

O Kling O1 no Novita AI dá aos desenvolvedores acesso a quatro modos distintos de geração de vídeo — T2V, I2V, Ref2V e Video Edit — por meio de uma única API unificada. T2V e I2V cobrem os casos comuns de geração a $0.112/s. O Ref2V adiciona composição de identidade com múltiplas referências para personagens recorrentes a $0.168/s. O Video Edit transforma filmagens existentes preservando o movimento, com uma variante Fast a $0.09/s para clipes mais longos. Escolher o modo certo antecipadamente economiza custos e remove atrito: comece com T2V se você não tem um ativo de imagem, I2V se tem, Ref2V quando a consistência de identidade entre clipes importa, e Video Edit quando o movimento já está capturado. Todos os modos compartilham o mesmo padrão de tarefas assíncronas no Novita AI, então integrar vários modos em um único pipeline exige código adicional mínimo.

A Novita AI é uma plataforma de nuvem de IA que dá aos desenvolvedores acesso hospedado a modelos de vídeo, imagem, áudio e linguagem por meio de uma API unificada.

Perguntas Frequentes

Qual é a diferença entre o Kling O1 T2V e o I2V no Novita AI?

O T2V gera vídeo a partir de um prompt de texto apenas — nenhuma imagem é necessária. O I2V usa uma imagem como quadro inicial e a anima de acordo com o prompt. Ambos são precificados a $0.112/s e suportam clipes de 5 a 10 segundos. Use o T2V para exploração; use o I2V quando você tiver uma âncora visual específica.

O que o Kling O1 Ref2V faz que o I2V não consegue?

O Ref2V aceita até 7 imagens de referência em vários slots de entrada, permitindo combinar fontes separadas para identidade de personagem, fundo de cena e estilo. Você referencia cada entrada pelo nome no prompt (@Element1, @Image1). O I2V usa um único quadro inicial sem sistema de referência nomeado.

O Kling O1 é o mesmo que o Kling 3.0?

Não. O Kling O1 (lançado em dezembro de 2025) é o modelo de vídeo multimodal unificado base. O Kling 3.0 (também chamado de Kling O3, lançado em fevereiro de 2026) é um sucessor que adiciona co-geração de áudio nativo e clipes de até 15 segundos. O Kling O1 no Novita AI suporta vídeo de até 10 segundos sem áudio nativo.

Como escolher entre o VideoEdit standard e o VideoEdit Fast?

O VideoEdit Standard aceita clipes de origem de 3 a 10 segundos a $0.168/s. O VideoEdit Fast aceita clipes de 6 a 20 segundos a $0.09/s. Se o seu vídeo de origem tiver menos de 10 segundos e o tempo de resposta for importante, use o standard. Se você tiver clipes mais longos ou estiver fazendo trabalhos de pós-produção em lote, o Fast é significativamente mais barato.

Artigos Recomendados