Uma ideia escrita já pode virar uma cena pronta para uso? Este guia mostra como o Gemini transforma comandos em resultados visuais no Agent Studio e na API Agent Platform. O processo também aceita uma foto, uma descrição ou os dois juntos.
O leitor conhecerá o Nano Banana, nome dos recursos nativos de geração imagens do serviço. Também verá como escolher o modelo certo, ajustar proporções como 16:9 e refinar uma imagem com instruções simples.
O Gemini 3.1 Flash Image oferece saídas em 1K, 2K e 4K. Além disso, cada resultado recebe a marca-d’água SynthID. A abordagem compara o uso no Gemini, no Google AI Studio, na API Gemini, na Agent Platform e no Firebase AI Logic, conforme a documentação atualizada em 8 de agosto de 2026.
Principais conclusões
- Comandos de texto orientam a geração visual.
- O Nano Banana reúne os recursos nativos.
- É possível combinar descrição e referência.
- Há opções de resolução até 4K.
- A marca SynthID acompanha o resultado.
Entenda como o Gemini para criar imagens funciona
O fluxo visual começa com um comando, uma referência enviada ou a combinação dos dois. O Nano Banana reúne quatro opções na API, cada uma voltada a uma necessidade de custo, velocidade ou controle criativo.
O que é o Nano Banana e quais modelos geram conteúdo visual
O Nano Banana 2 Lite usa o modelo gemini-3.1-flash-lite-image. Ele é o mais rápido e econômico, indicado a operações em grande escala. O Nano Banana 2 usa o gemini-3.1-flash-image e equilibra velocidade, saída em 4K, conhecimento de mundo e boa renderização de texto.
O Nano Banana Pro corresponde ao gemini-3-pro-image. Ele atende marcas, campanhas e projetos que exigem raciocínio visual avançado. Já o Nano Banana legado usa o gemini-2.5-flash-image; a recomendação atual é migrar ao modelo Lite. Toda saída recebe marca-d’água SynthID.
Diferenças entre criação, edição e texto visual
Na criação, um anúncio nasce de uma descrição. Na edição, o comando altera uma foto, personagem ou infográfico de referência. Também é possível combinar texto e imagem na mesma resposta, formando materiais mais completos que uma cena isolada.
Antes de gerar imagens: acesso, configuração e recursos disponíveis
A escolha da ferramenta define o ritmo do processo. O aplicativo atende tarefas rápidas. O Google AI Studio serve aos testes. A API Gemini apoia automações, enquanto o Firebase AI Logic conecta recursos visuais ao aplicativo.
Uso no Gemini, Google AI Studio, API e Firebase AI Logic
Antes de executar qualquer código, a equipe deve conferir autenticação, formato de entrada e dados de imagem. No Python, a instalação usa pip install –upgrade google-genai. No Node.js, o comando é npm install @google/genai.
Na Vertex AI, a base exige GOOGLE_CLOUD_PROJECT, GOOGLE_CLOUD_LOCATION=global e GOOGLE_GENAI_USE_ENTERPRISE. Os modelos Gemini 3.x Image na Agent Platform funcionam somente na região global.

O Firebase AI Logic permite chamar generateContent diretamente no app. Porém, a geração requer o plano Blaze. Assim, o processo começa no AI Studio e migra ao ambiente produtivo após validar custos, acesso e código.
| Opção | Melhor uso | Requisito principal |
|---|---|---|
| AI Studio | Testes rápidos | Chave e autenticação |
| API | Automação | SDK atualizado |
| Firebase AI Logic | Apps conectados | Plano Blaze |
| Agent Platform | Operação empresarial | Local global |
Como escrever comandos eficientes para gerar imagens
Um bom resultado nasce de uma descrição clara e organizada. O comando deve informar objetivo, assunto, ação, ambiente, luz, enquadramento, público e materiais. A referência visual ajuda, mas não substitui detalhes escritos.

Elementos essenciais de uma descrição visual
As práticas recomendadas seguem uma ordem simples: objetivo primeiro, detalhes visuais depois e restrições no fim. Termos como “sem texto”, “fundo limpo” ou “sem pessoas” evitam interpretações indesejadas.
Estilo, composição, proporção e resolução
O estilo pode ser editorial, realista ou isométrico. A API aceita aspect_ratio: “16:9”. Use 1:1 em ícones, 9:16 em telas verticais e 16:9 em apresentações. Os modelos oferecem 1K, 2K e 4K; o Flash Image também aceita 512 pixels. O Flash Lite fica limitado a 1K.
Exemplos de comandos de texto
- Capa: capa azul de revista, título “Nano Banana”, data “Fev 2026”, tipografia clara e código de barras visível.
- Cena: Londres em estilo isométrico, título, ícone de clima, data e temperatura no topo.
Após cada resultado, revise a posição, o texto e o estilo. Um novo comando específico costuma corrigir falhas sem perder a composição.
Como gerar imagens usando o Gemini na prática
Em poucos cliques, uma descrição ganha forma no Agent Studio. A primeira etapa começa em Criar comando. Depois, o usuário seleciona Mudar modelo e escolhe uma opção compatível com saída visual.
Criação de uma imagem a partir de texto
Na segunda etapa, basta escrever a cena no campo de comando. Um exemplo pede uma sobremesa de banana em um restaurante sofisticado, com tema Gemini, luz quente e composição elegante. Após o envio, o sistema leva alguns segundos para apresentar a foto ou a ilustração.
A duração pode aumentar conforme a capacidade disponível. Por isso, a foto gerada merece uma revisão atenta antes do uso. O comando deve orientar o enquadramento, o estilo e os elementos principais.
Escolha do formato, qualidade e modalidade de resposta
No painel Saídas, a opção “Imagem e texto” retorna as duas modalidades. Na API Interactions, interaction.output_image permite acessar e salvar a foto em PNG ou outro formato.
O ajuste aspect_ratio: “16:9” cria uma composição horizontal. Já image_size: “2K” melhora a definição. Ao avaliar imagens a partir de texto, a etapa final deve conferir proporção, nitidez, legibilidade e fidelidade ao comando. A mesma etapa vale ao produzir imagens a partir de uma nova descrição.
| Configuração | Função | Exemplo |
|---|---|---|
| Modelo | Define a saída visual | Modelo compatível |
| Modalidade | Une conteúdo escrito e visual | Imagem e texto |
| Proporção | Controla o enquadramento | 16:9 |
| Qualidade | Define a resolução | 2K |
Como editar imagens e trabalhar com imagens de referência
Uma foto existente pode ganhar novos detalhes sem perder sua identidade. Basta enviar o arquivo junto com um comando de texto claro. Assim, o usuário consegue adicionar, remover ou modificar objetos, cores, luz e composição.
Adição, remoção e alteração de elementos visuais
Um pedido pode inserir um logotipo em uma garrafa de perfume ou traduzir um infográfico de fotossíntese ao espanhol. O comando deve indicar o que muda e o que permanece igual.
“Altere apenas o texto; mantenha cores, formas e posição dos elementos.”
Na edição de imagens, essa precisão reduz erros e preserva partes importantes da imagem gerada. A Pesquisa Google e a Pesquisa de Imagens do Google também ajudam em temas atuais, clima e dados factuais.
Consistência de personagens, objetos, marcas e estilos
Os modelos Gemini 3 combinam até 14 referências. O Flash Image aceita quatro fotos de personagens, enquanto o Pro Image aceita cinco. O Flash Lite aceita três referências de estilo.
No Firebase AI Logic, uma conversa mantém o contexto entre ajustes. Na API, previous_interaction_id continua a edição multiturno. Antes do envio, é essencial confirmar os direitos de uso e evitar conteúdo que prejudique terceiros.
Como criar respostas com textos e imagens intercaladas
Uma única solicitação pode montar uma narrativa completa, com instruções e recursos visuais no mesmo retorno. O Gemini organiza as respostas conforme o pedido, sem exigir uma chamada diferente a cada etapa.
Na receita de paella, o comando pede títulos numerados, explicações breves e uma figura quadrada ligada a cada instrução. Assim, as imagens intercaladas acompanham o preparo e tornam a leitura mais clara.
Tutoriais culinários em um único retorno
Outro exemplo apresenta um sanduíche de manteiga de amendoim e geleia em três passos simples. O formato texto e imagens combina ação, medida e resultado visual em uma sequência fácil de seguir.
“Mostre três etapas numeradas, com uma explicação curta e uma figura 1:1 após cada etapa.”
No código Go, as modalidades Text e Image ficam ativas ao mesmo tempo. O programa percorre cada parte recebida e grava textos e arquivos visuais no Markdown paella-recipe.md. Esse fluxo atende receitas, aulas, tutoriais e páginas de produto. Também melhora a acessibilidade, pois cada recurso visual aparece logo depois da instrução correspondente.
Conclusão
O Gemini oferece caminhos flexíveis: produção visual, edição de referências e respostas que combinam texto com recursos gráficos. A escolha entre Nano Banana 2 Lite, Nano Banana 2 e Nano Banana Pro depende de custo, velocidade, resolução, consistência e complexidade.
Comandos objetivos orientam assunto, estilo, proporção, composição e limites. O Agent Studio atende testes manuais. Já a API Gemini e o Firebase AI Logic apoiam automações e aplicativos. A edição multiturno preserva o contexto e facilita ajustes progressivos.
Antes de publicar, é importante conferir a marca SynthID, os direitos das referências e as políticas de uso. A documentação do Google Cloud, atualizada em 8 de agosto de 2026, serve como base atual. Assim, cada geração visual pode unir qualidade, controle e responsabilidade.