- O que é o Kling O1?
- Os Quatro Modos em Resumo
- Kling O1 Text-to-Video (T2V) no Novita AI
- Kling O1 Image-to-Video (I2V) no Novita AI
- Kling O1 Reference-to-Video (Ref2V) no Novita AI
- Modo Video Edit do Kling O1 no Novita AI
- Preços no Novita AI
- Com Qual Modo Você Deve Começar?
- Como Chamar a API do Kling O1 no Novita AI
- Conclusão
- Perguntas Frequentes
- Artigos Recomendados
O Kling O1 (Kling Omni Video O1) é o primeiro modelo de vídeo multimodal unificado da Kuaishou, expondo quatro modos de geração distintos por meio da API da Novita AI: Text-to-Video (T2V), Image-to-Video (I2V), Reference-to-Video (Ref2V) e Video Edit. Cada modo aceita entradas diferentes e resolve um problema diferente — escolher o errado adiciona atrito e custo. Este guia explica o que cada modo realmente faz, o que ele exige, como é precificado no Novita AI e qual experimentar primeiro para casos de uso comuns de desenvolvedores.
O que é o Kling O1?
O Kling O1 é construído sobre a arquitetura MVL (Multimodal Visual Language) da Kuaishou, que consolida tarefas de texto, imagem, referência e edição de vídeo em um único modelo, em vez de direcioná-las para modelos especializados separados. Isso importa na prática: o modelo de movimento subjacente e a codificação de identidade são compartilhados entre os modos, de modo que personagens e objetos descritos em um modo carregam propriedades visuais consistentes para o próximo.
Em comparação com versões anteriores do Kling (V2.5, V2.6, V3.0 Standard/Pro), o Kling O1 adiciona capacidades de Ref2V e Video Edit que são estruturalmente novas — elas não estavam disponíveis em nenhum nível Standard ou Pro antes do O1. T2V e I2V no O1 ganham a espinha dorsal MVL compartilhada, o que melhora a consistência do assunto entre os quadros em comparação com os modelos de geração anteriores.
O Kling O1 é distinto do Kling 3.0 (também chamado de Kling O3). O Kling 3.0 é um modelo sucessor que adiciona co-geração de áudio nativo e clipes estendidos de 15 segundos. O Kling O1 no Novita AI atualmente cobre vídeos de até 10 segundos sem áudio nativo.
Os Quatro Modos em Resumo
| Modo | Entrada Principal | Entradas Obrigatórias | Duração | Preço no Novita AI |
|---|---|---|---|---|
| T2V | Prompt de texto | prompt |
5–10 s | $0.112/s |
| I2V | Imagem + prompt | image_url, prompt |
5–10 s | $0.112/s |
| Ref2V | Imagens de referência + prompt | prompt, image_urls ou elements |
3–10 s | $0.168/s |
| Video Edit | Vídeo de origem + prompt | video_url, prompt |
3–10 s (Fast: 6–20 s) | $0.168/s (Fast: $0.09/s) |
Preços verificados nas páginas de modelos do Novita AI em 2026-06-26. A cobrança por segundo se aplica à duração que você especificar.
Kling O1 Text-to-Video (T2V) no Novita AI
Endpoint: POST /v3/async/kling-o1-t2v
O T2V gera um vídeo inteiramente a partir de uma descrição em texto. Você fornece um prompt; o modelo cria movimento, iluminação, movimentação de câmera e composição de cena do zero. Não há uma âncora de imagem, então o modelo tem latitude criativa total dentro das restrições do prompt.
Use T2V quando:
- Você não tem uma imagem de referência ou quadro de cena.
- Você está explorando um conceito antes de se comprometer com uma direção visual.
- Você precisa gerar muitas variações visuais com baixo custo por clipe.
A $0.112/s, um clipe de 5 segundos custa $0.56 e um clipe de 10 segundos custa $1.12. O T2V suporta durações de 5 e 10 segundos no Novita AI com proporções de aspecto 16:9, 9:16 e 1:1.
curl --request POST \
--url https://api.novita.ai/v3/async/kling-o1-t2v \
--header 'Authorization: Bearer $NOVITA_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"prompt": "A red fox trotting through a snowy pine forest, golden hour light, cinematic wide shot",
"duration": 5,
"aspect_ratio": "16:9"
}'
Kling O1 Image-to-Video (I2V) no Novita AI
Endpoint: POST /v3/async/kling-o1-i2v
O I2V anima uma imagem estática em um clipe de vídeo. A imagem de origem se torna o quadro inicial; o prompt controla o movimento e o desenvolvimento de cena que se seguem. Você pode opcionalmente fornecer um quadro final para dar ao modelo um estado alvo, e o modelo interpola o movimento entre o início e o fim.
Obrigatórios: image_url (quadro inicial) e prompt. O quadro final (end_image_url) é opcional, mas útil quando você quer uma composição específica no ponto de corte.
Use I2V quando:
- Você tem uma imagem ou design existente que precisa se mover.
- Você quer um ancoramento visual determinístico — a aparência do personagem ou da cena já está definida na imagem de origem.
- Você está criando demos de produtos, conteúdo para redes sociais ou animações de e-commerce a partir de ativos existentes.
A $0.112/s, o I2V custa o mesmo que o T2V. A principal compensação é que o I2V fixa o quadro de abertura à sua imagem de entrada, o que melhora a consistência, mas também significa que uma imagem de origem de baixa qualidade limita a saída. Restrições de imagem no Novita AI: mínimo de 300×300px, tamanho máximo de arquivo de 10MB, proporção de aspecto entre 0.4 e 2.5.
curl --request POST \
--url https://api.novita.ai/v3/async/kling-o1-i2v \
--header 'Authorization: Bearer $NOVITA_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"image_url": "https://example.com/product-shot.jpg",
"prompt": "The product slowly rotates to reveal the back panel, soft studio lighting",
"duration": 5,
"aspect_ratio": "1:1"
}'
Kling O1 Reference-to-Video (Ref2V) no Novita AI
Endpoint: POST /v3/async/kling-o1-ref2v
O Ref2V é o modo mais flexível e o que usa mais diretamente a arquitetura MVL do O1. Em vez de um único quadro inicial, você fornece até sete imagens de referência em dois tipos de entrada: image_urls (referências de estilo ou cena) e elements (âncoras de identidade de personagem ou objeto). O prompt usa tags @Image1, @Image2, @Element1, @Element2 para dizer ao modelo qual referência aplicar e onde.
Isso permite compor uma cena a partir de múltiplos ativos de origem: um personagem de uma foto de retrato, um fundo de uma imagem de local e um adereço de uma imagem de produto — todos referenciados pelo nome no prompt.
Regras de entrada:
prompté obrigatório.image_urlseelementssão opcionais, mas pelo menos um deve ser significativo; um prompt puro sem referências funciona, mas se comporta de forma mais próxima ao T2V.- O total de referências (elements + image_urls) não deve exceder 7.
- Cada elemento em
elementspode incluir váriosreference_image_urls(tomadas de múltiplos ângulos) além de umfrontal_image_urlopcional para uma correspondência de identidade mais limpa.
Use Ref2V quando:
- Você precisa de personagens consistentes em vários clipes (conteúdo episódico, sequências de marketing).
- Você está combinando personagens ou objetos de diferentes imagens de origem em uma única cena.
- Você quer que o modelo interpole a partir de um quadro inicial enquanto mantém a identidade visual de um conjunto de referências separado.
O Ref2V custa $0.168/s — 50% a mais que T2V e I2V. Para um clipe de 5 segundos, isso dá $0.84; para 10 segundos, $1.68. O preço mais alto reflete a etapa adicional de codificação de referência. Se o seu caso de uso não exigir consistência de identidade entre imagens, o I2V a $0.112/s é suficiente.
curl --request POST \
--url https://api.novita.ai/v3/async/kling-o1-ref2v \
--header 'Authorization: Bearer $NOVITA_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"prompt": "Take @Image1 as the start frame. @Element1 walks into the scene and picks up the glowing artifact. Cinematic lighting, steady camera.",
"image_urls": ["https://example.com/scene-bg.jpg"],
"elements": [
{
"reference_image_urls": ["https://example.com/character-front.jpg", "https://example.com/character-side.jpg"],
"frontal_image_url": "https://example.com/character-front.jpg"
}
],
"duration": 5,
"aspect_ratio": "16:9"
}'
Modo Video Edit do Kling O1 no Novita AI
Endpoint (standard): POST /v3/async/kling-o1-video-edit
Endpoint (fast): disponível por meio da variante Fast VideoEdit da Novita AI
O Video Edit recebe um vídeo existente como entrada e o transforma usando um prompt em linguagem natural. O modelo preserva a estrutura de movimento original — timing, movimentação de câmera, o arco de ação — enquanto altera assuntos, ambientes ou estilo visual de acordo com o prompt. Você também pode fornecer imagens de referência e âncoras de elementos usando o mesmo sistema de marcação @Image1 / @Element1 do Ref2V.
Obrigatórios: video_url (vídeo de origem, 3–10s, MP4 ou MOV, 720–2160px, máx. 200MB) e prompt.
Duas variantes:
- Standard VideoEdit: suporta vídeos de origem de 3 a 10 segundos, precificado a $0.168/s.
- Fast VideoEdit: suporta vídeos de origem de 6 a 20 segundos, precificado a $0.09/s — o menor custo por segundo entre todos os modos do Kling O1 no Novita AI.
Use Video Edit quando:
- Você tem filmagens que precisam de uma mudança de estilo ou conteúdo sem refilmagem.
- Você quer substituir um personagem em um vídeo existente mantendo o mesmo movimento.
- Você precisa transformar um clipe live-action em um estilo animado.
A principal limitação: o vídeo de origem controla o movimento. O Video Edit não pode mudar o que um assunto faz — ele só pode mudar a aparência do assunto e o ambiente que ele ocupa. Para mudanças de movimento, gere novas filmagens com T2V ou I2V.
curl --request POST \
--url https://api.novita.ai/v3/async/kling-o1-video-edit \
--header 'Authorization: Bearer $NOVITA_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"video_url": "https://example.com/source-clip.mp4",
"prompt": "Transform the setting to a neon-lit cyberpunk alley, keep the character movements exactly as-is",
"duration": 5
}'
Preços no Novita AI
Todos os modos do Kling O1 no Novita AI usam cobrança por segundo com base na duração definida no momento da solicitação. Preços verificados em 2026-06-26.
| Modo | Endpoint | Faixa de Duração | Preço/s | Custo 5s | Custo 10s |
|---|---|---|---|---|---|
| T2V | /v3/async/kling-o1-t2v |
5–10 s | $0.112 | $0.56 | $1.12 |
| I2V | /v3/async/kling-o1-i2v |
5–10 s | $0.112 | $0.56 | $1.12 |
| Ref2V | /v3/async/kling-o1-ref2v |
3–10 s | $0.168 | $0.84 | $1.68 |
| VideoEdit | /v3/async/kling-o1-video-edit |
3–10 s | $0.168 | $0.84 | $1.68 |
| VideoEdit Fast | (variante Fast da Novita AI) | 6–20 s | $0.090 | — | $0.90 |
Novos usuários do Novita AI recebem créditos gratuitos. Consulte a página de preços do Novita AI para tarifas atuais, pois os preços podem mudar.
Com Qual Modo Você Deve Começar?
Comece com T2V se o seu objetivo é explorar conceitos ou se você não tem um ativo de imagem específico. É o ponto de entrada com menos atrito: um parâmetro obrigatório (prompt), sem necessidade de preparação de ativos.
Passe para I2V quando tiver uma imagem que precisa se mover. Imagens de produto, ilustrações de personagens e fundos de cena funcionam bem como quadros iniciais do I2V. Mesmo preço do T2V, com mais controle visual.
Use Ref2V quando a consistência de identidade entre clipes for importante — por exemplo, um personagem recorrente em várias cenas, ou combinar uma pessoa específica com um ambiente específico. Reserve orçamento para o aumento de 50% no preço; ele não é necessário para geração de um único clipe.
Reserve o Video Edit para fluxos de pós-produção em que as filmagens existentes precisam de uma reformulação visual, mas o movimento deve permanecer intacto. A variante Fast a $0.09/s é a opção mais econômica para edições mais longas (6 a 20 segundos) onde a velocidade de geração é menos crítica.
| Situação | Modo Recomendado |
|---|---|
| Sem imagem, explorando ideias | T2V |
| Tem uma imagem de produto ou cena, quer movimento | I2V |
| Precisa do mesmo personagem em vários clipes | Ref2V |
| Tem filmagens, quer um visual diferente | VideoEdit (standard) |
| Edição longa (6–20 s), sensível a custo | VideoEdit Fast |
Como Chamar a API do Kling O1 no Novita AI
Todos os quatro modos do Kling O1 no Novita AI são assíncronos. Cada solicitação retorna um task_id imediatamente; faça polling no endpoint Task Result até que o status seja succeed.
# Step 1: Submit your generation task (example: T2V)
RESPONSE=$(curl --silent --request POST \
--url https://api.novita.ai/v3/async/kling-o1-t2v \
--header "Authorization: Bearer $NOVITA_API_KEY" \
--header "Content-Type: application/json" \
--data '{"prompt": "Your prompt here", "duration": 5, "aspect_ratio": "16:9"}')
TASK_ID=$(echo $RESPONSE | python3 -c "import sys,json; print(json.load(sys.stdin)['task_id'])")
# Step 2: Poll for results
curl --request GET \
--url "https://api.novita.ai/v3/async/task-result?task_id=$TASK_ID" \
--header "Authorization: Bearer $NOVITA_API_KEY"
A resposta inclui um campo status. Quando ele estiver como succeed, o array videos contém a URL de saída. O tempo típico de geração é de 30 a 120 segundos, dependendo da duração e do modo.
Obtenha sua chave de API no painel do Novita AI. Novas contas recebem créditos gratuitos para testar todos os quatro modos antes de se comprometer com volume de produção.
Conclusão
O Kling O1 no Novita AI dá aos desenvolvedores acesso a quatro modos distintos de geração de vídeo — T2V, I2V, Ref2V e Video Edit — por meio de uma única API unificada. T2V e I2V cobrem os casos comuns de geração a $0.112/s. O Ref2V adiciona composição de identidade com múltiplas referências para personagens recorrentes a $0.168/s. O Video Edit transforma filmagens existentes preservando o movimento, com uma variante Fast a $0.09/s para clipes mais longos. Escolher o modo certo antecipadamente economiza custos e remove atrito: comece com T2V se você não tem um ativo de imagem, I2V se tem, Ref2V quando a consistência de identidade entre clipes importa, e Video Edit quando o movimento já está capturado. Todos os modos compartilham o mesmo padrão de tarefas assíncronas no Novita AI, então integrar vários modos em um único pipeline exige código adicional mínimo.
A Novita AI é uma plataforma de nuvem de IA que dá aos desenvolvedores acesso hospedado a modelos de vídeo, imagem, áudio e linguagem por meio de uma API unificada.
Perguntas Frequentes
Qual é a diferença entre o Kling O1 T2V e o I2V no Novita AI?
O T2V gera vídeo a partir de um prompt de texto apenas — nenhuma imagem é necessária. O I2V usa uma imagem como quadro inicial e a anima de acordo com o prompt. Ambos são precificados a $0.112/s e suportam clipes de 5 a 10 segundos. Use o T2V para exploração; use o I2V quando você tiver uma âncora visual específica.
O que o Kling O1 Ref2V faz que o I2V não consegue?
O Ref2V aceita até 7 imagens de referência em vários slots de entrada, permitindo combinar fontes separadas para identidade de personagem, fundo de cena e estilo. Você referencia cada entrada pelo nome no prompt (@Element1, @Image1). O I2V usa um único quadro inicial sem sistema de referência nomeado.
O Kling O1 é o mesmo que o Kling 3.0?
Não. O Kling O1 (lançado em dezembro de 2025) é o modelo de vídeo multimodal unificado base. O Kling 3.0 (também chamado de Kling O3, lançado em fevereiro de 2026) é um sucessor que adiciona co-geração de áudio nativo e clipes de até 15 segundos. O Kling O1 no Novita AI suporta vídeo de até 10 segundos sem áudio nativo.
Como escolher entre o VideoEdit standard e o VideoEdit Fast?
O VideoEdit Standard aceita clipes de origem de 3 a 10 segundos a $0.168/s. O VideoEdit Fast aceita clipes de 6 a 20 segundos a $0.09/s. Se o seu vídeo de origem tiver menos de 10 segundos e o tempo de resposta for importante, use o standard. Se você tiver clipes mais longos ou estiver fazendo trabalhos de pós-produção em lote, o Fast é significativamente mais barato.
