Quando usar Reference to Video
Use Reference to Video quando você precisar de:- Consistência de personagem — a mesma pessoa ou personagem em várias tomadas
- Precisão de produto — um produto real que deve parecer idêntico ao original
- Continuidade de cena — um ambiente ou plano de fundo específico entre gerações
- Cenas multi-personagem — vários personagens distintos interagindo sem se misturar
Modelos disponíveis
O Kling O3 usa uma abordagem estruturada com Elements (âncoras de identidade de personagem com imagens frontais + de referência) e Scene Images. O Grok Imagine R2V usa uma abordagem mais simples — você faz upload de imagens de referência diretamente e as referencia no seu prompt com
@Image1, @Image2 etc.
Kling O3 Reference to Video
Conceitos centrais
O Kling O3 Reference to Video usa três tipos de entrada visual que trabalham juntas:
*Pelo menos um de: start frame, elements ou scene reference images é obrigatório.
Elements
Um Element é um personagem ou objeto que você quer manter visualmente estável ao longo do vídeo. Cada elemento consiste em:- Frontal Image (obrigatória por elemento) — uma foto clara, de frente, do sujeito. Esta é a âncora de identidade primária. Pense nela como a “foto de passaporte” do seu personagem ou produto.
- Reference Images (1–3, opcionais) — ângulos adicionais do mesmo sujeito (vista lateral, 45 graus, costas). Eles ajudam o modelo a entender o sujeito no espaço 3D. Se não forem fornecidas, a imagem frontal é automaticamente usada como referência.
@Element1, @Element2 etc.
Scene Reference Images
As referências de cena definem o “palco” onde a ação acontece. Elas influenciam:- Iluminação e paleta de cores
- Arquitetura e detalhes do ambiente
- Estilo visual geral e atmosfera
@Image1, @Image2 etc. no seu prompt.
Limitações
O número total de imagens em todos os tipos de entrada é limitado:
Exemplos de cenários:
- 7 elements + 0 scene images = 7 ✓ (sem frames)
- 5 elements + 2 scene images = 7 ✓ (sem frames)
- Primeiro frame (1) + 3 elements + 3 scene images = 7 ✓
- Primeiro frame (1) + último frame (1) + 3 elements + 2 scene images = 7 ✓
- Primeiro frame (1) + 4 elements = ✗ (máx. 3 elements com frame)
- Primeiro frame (1) + último frame (1) + 4 elements = ✗ (máx. 3 elements com frames)
Cada element requer uma imagem frontal. Se você não fornecer reference images para um element, a imagem frontal é usada automaticamente como referência.
Modo multi-shot
O multi-shot permite quebrar uma única geração em várias cenas, cada uma com seu próprio prompt e duração. Elements e scene references são mantidos em todos os shots, mantendo a consistência. A duração total em todos os shots não pode exceder 15 segundos.Guia passo a passo (Video Studio)
1. Abra o Video Studio e selecione o modelo
Vá em venice.ai/video. No Model Browser à esquerda, selecione um dos modelos Kling O3 Reference to Video:- Kling O3 Pro R2V — maior qualidade, tempo de geração mais longo (~6 min)
- Kling O3 Standard R2V — mais rápido, mais econômico para iteração
2. Adicione Visual Inputs (pelo menos um obrigatório)
Você deve fornecer pelo menos uma entrada visual para gerar um vídeo: um start frame, um element ou uma scene reference image. No Input Panel, você verá a seção Elements. Clique em Add Element para criar um element para personagens ou objetos que você quer manter visualmente consistentes. Para cada element:- Clique no quadro Frontal para fazer upload de uma imagem clara, de frente, do seu personagem ou objeto
- Opcionalmente clique em Add sob Reference Images para fazer upload de ângulos adicionais (1–3)
3. Adicione Scene Reference Images (opcional)
Abaixo da seção Elements, você verá Scene Reference Images. Faça upload de imagens que definam o ambiente que você quer — uma localização específica, esquema de iluminação ou estilo artístico. Elas são automaticamente marcadas como@Image1, @Image2 etc.
4. Faça upload de um Start Frame (opcional)
Se você quiser controlar o primeiro frame exato do seu vídeo, mude para o tipo de entrada Image e faça upload de um start frame. Você também pode opcionalmente definir um end frame.5. Escreva seu prompt
No campo de prompt, descreva a ação que você quer, referenciando seus elements e scene images usando as tags@:
6. Configure as definições
Abra Video Settings para ajustar:A geração de áudio adiciona efeitos sonoros nativos, diálogo e áudio ambiente sincronizados com o vídeo. Aumenta o custo em ~25%.
7. Gere
Clique em Generate Video. O Kling O3 normalmente leva 4–6 minutos dependendo do tier do modelo e da duração. Você pode enfileirar várias gerações e navegar pelos resultados na Video Gallery.Storyboarding multi-shot
Para sequências narrativas, use o modo multi-shot para definir cenas separadas dentro de uma única geração.- Na área de prompt, clique em Add Shot para criar shots adicionais
- Escreva um prompt separado para cada shot
- Defina a duração para cada shot (3–15s cada, total ≤ 15s)
Dicas de prompting
Estruture seu prompt
Siga este padrão para resultados confiáveis:Mantenha prompts entre 50–150 palavras
Prompts mais curtos carecem de detalhes. Prompts mais longos introduzem contradições. Mire no ponto ideal.Use linguagem de câmera simples
O modelo responde melhor a direções de câmera diretas:Use vocabulário consistente
Se você descreve um personagem usando “a red jacket” em um prompt, não troque para “crimson coat” no próximo. O modelo trata palavras diferentes como intenções diferentes.Coloque instruções de câmera no início
Coloque a direção de câmera próximo ao começo do prompt para resultados mais confiáveis:Preços do Kling O3
Os modelos Kling O3 Reference to Video usam preços baseados em duração:
Exemplo: Um vídeo de 10 segundos com áudio = 10 × 1,40**
Use a Video Quote API para preços exatos antes da geração.
Uso da API Kling O3
O Kling O3 Reference to Video também está disponível via API Venice. Veja a Video Queue API para detalhes completos.Python
Node.js
cURL
Schema do element
Cada element no arrayelements aceita:
A API também suporta
video_url para elements baseados em vídeo, mas isso atualmente não está disponível na UI do Video Studio.Solução de problemas do Kling O3
Grok Imagine Reference to Video
O Grok Imagine R2V usa uma abordagem mais simples que o Kling O3. Em vez de Elements estruturados com separação frontal/reference image, você faz upload de imagens de referência planas e as referencia diretamente no seu prompt usando@Image1, @Image2 etc. O modelo incorpora esses sujeitos no vídeo gerado.
Como funciona
- Faça upload de 1–7 imagens de referência — fotos de personagens, objetos ou cenas que você quer no vídeo
- Escreva um prompt que descreva o vídeo, usando
@Image1,@Image2etc. para referenciar imagens específicas - O modelo gera um vídeo incorporando essas referências
@Image no seu prompt, todas as imagens enviadas são referenciadas automaticamente.
Configurações
O Grok Imagine R2V não suporta geração de áudio, modo multi-shot ou Elements. Para esses recursos, use Kling O3 R2V.
Guia passo a passo (Video Studio)
1. Selecione o modelo
Vá em venice.ai/video. No Model Browser, selecione Grok Imagine R2V.2. Faça upload das imagens de referência
Clique em References na barra de ferramentas de entrada (ou use o menu +) para abrir o painel de imagens de referência. Faça upload de 1–7 imagens dos personagens, objetos ou cenas que você quer no vídeo. Cada imagem é automaticamente marcada como@Image1, @Image2 etc. na ordem em que você as envia (da esquerda para a direita).
3. Escreva seu prompt
Descreva o vídeo que você quer. Use tags@Image para referenciar imagens específicas:
@ no campo de prompt para ver um menu de autocomplete das referências de imagem disponíveis.
4. Configure as definições e gere
Abra Video Settings para ajustar aspect ratio, resolução e duração. Clique em Generate Video.Preços do Grok Imagine R2V
O Grok Imagine R2V usa preços baseados em duração e resolução:
Exemplo: Um vídeo de 8 segundos em 480p = 8 × 0,50**
O Grok Imagine cobra uma taxa de moderação de conteúdo para vídeos gerados, mesmo se o vídeo for rejeitado. Isso é refletido no custo de créditos exibido antes da geração.
Uso da API Grok Imagine R2V
Python
Node.js
cURL
Parâmetros da API
O Grok Imagine R2V não usa os campos
elements, image_urls ou imageUrl. Todas as imagens de referência são passadas via referenceImageUrls.