Nano Banana 2.1: o que muda quando a imagem vira um "head" de um modelo de texto
o novo modelo de imagem do Google não é um gerador de imagens — é um modelo de linguagem multimodal que devolve pixels, e é essa arquitetura que explica tanto os recursos novos quanto os limites que a própria empresa admite.
o novo modelo de imagem do Google não é um gerador de imagens — é um modelo de linguagem multimodal que devolve pixels, e é essa arquitetura que explica tanto os recursos novos quanto os limites que a própria empresa admite.
O que o modelo é, por dentro
O Nano Banana 2.1, lançado em 6 de outubro de 2026, é um head de imagem sobre o Gemini 3.6 Flash. A frase parece jargão, mas descreve a mudança de categoria: o que o usuário vê é um gerador de imagens; o que existe por baixo é um modelo multimodal nativo da família Gemini 3, que entende texto e imagem (o model card cita até 1M de tokens de contexto na entrada), raciocina em níveis configuráveis e devolve imagem mais texto.
A herança tem data: o cutoff de conhecimento é março de 2026, com domínios limitados a janeiro de 2025. E a linhagem é direta — o 2.1 substitui o Nano Banana 2 (Gemini 3.1 Flash Image), enquanto o Nano Banana Pro, sobre o Gemini 3 Pro, segue como topo de qualidade.
A alavanca mais interessante: thinking configurável
Entre os parâmetros que a API aceita, um merece destaque por razão econômica e não estética: o thinking configurável, em três níveis — minimal, medium (padrão) e high.
O próprio Google mede a diferença: o modelo com thinking alcança Elo 1050 em preferência geral, contra 1015 sem. Traduzindo para quem paga a conta: a mesma API permite gastar menos compute quando o caso não exige raciocínio profundo e mais compute quando exige. É a alavanca visível de uma relação que, do lado do servidor, é puramente física — mais thinking significa mais cálculo nos pods de TPU, com a mesma chamada de API.
O que entrou e o que continua faltando
As melhorias anunciadas são específicas, e vale listá-las para que a promessa fique verificável:
- melhor qualidade e realismo nas três resoluções (1K, 2K e 4K);
- fim dos artefatos de emenda (tiling) em panoramas nas proporções 1:4, 4:1, 1:8 e 8:1, em 2K e 4K;
- melhor desempenho em texto dentro da imagem e infográficos;
- fusão de múltiplas imagens: até 14 referências, com consistência de até 4 personagens e 10 objetos;
- grounding em Web e Image Search.
A especificação de I/O é igualmente concreta: 1.120 tokens por imagem de entrada; saída de 1.120 tokens para imagem em 1K e 1.680 em 2K; imagem final em 1K, 2K ou 4K (padrão 1K); e texto de saída de até 64K. Formatos de saída: PNG, JPEG, WebP, HEIC e HEIF.
Agora a parte que costuma ser omitida em lançamentos: as limitações admitidas no model card. O Google reconhece texto pequeno borrado em 1K e problemas com parágrafos longos; consistência de personagem imperfeita; persistência parcial em edição com máscara; confusão espacial entre esquerda e direita; desempenho limitado em 3D e em factualidade; e timeouts ocasionais. Também registra que geração de pessoas está indisponível na Enterprise.
Isso não é um detalhe de rodapé. É o que permite ao leitor calibrar a promessa — e a diferença entre um lançamento que se apresenta como resolvido e um que declara onde falha.
Onde ele roda e o que não é suportado
A distribuição cobre sete superfícies — app Gemini, AI Mode na Busca, AI Studio, Gemini API, Flow, Stitch e Google Ads — mais a Gemini Enterprise Platform, onde o modelo entrou em disponibilidade geral no mesmo dia, sob o identificador `gemini-nano-banana-2-1`.
Nos parâmetros de plataforma, há uma lista de suportados e outra de recusados que diz bastante sobre o tipo de modelo. A API aceita reasoning, system instructions, context caching implícito, token counting, grounding, provisioned throughput e batch. E não aceita seed, topK, topP, temperature nem logprobs — retornando erro de API. Ou seja: controles clássicos de amostragem estocástica simplesmente não existem nessa interface. A variação é gerenciada por outro caminho, e não é possível fixar uma semente para reproduzir uma imagem exatamente.
Há também uma dependência que vale nomear, porque é dela que vem parte da credibilidade do produto: o C2PA (Content Credentials), o padrão de proveniência que marca a origem do conteúdo gerado. Em um mercado em que a autenticidade visual virou questão prática, é um recurso de confiança, não de qualidade de imagem.
Uma divergência que o Google não explicou
Vale registrar uma inconsistência entre dois documentos oficiais do próprio Google, porque ela não é uma lacuna de investigação — é uma contradição documentada.
O model card do Nano Banana 2.1 informa até 1M de tokens de contexto na entrada. Já a documentação da Enterprise Platform lista 131.072 tokens de entrada e 32.768 de saída. A hipótese mais provável é diferença de canal — a API completa contra a versão corporativa em GA —, mas nenhuma fonte explica a diferença, e as duas são oficiais.
Há ainda uma recursão incômoda na cadeia de documentação: o model card do 2.1 remete ao card do Gemini 3.6 Flash, que por sua vez remete ao do 3.5. Os pesos e a arquitetura detalhada nunca chegam a um documento público.
O que o software revela sobre o hardware
A relação entre as duas camadas aqui é de subordinação total, e o próprio model card assume isso: não há hardware ou software exigido do usuário. O modelo só roda em TPUs do Google, e o usuário nunca vê essa camada.
O thinking configurável é a única fresta visível dessa relação. Cada nível a mais significa mais cálculo por chamada no mesmo endpoint — e é o que permite ao Google vender, na mesma API, uma opção barata e uma opção cara, ajustando o custo por imagem sem tocar no preço de tabela. Um modelo de imagem tradicional não teria essa alavanca; um head de um modelo de linguagem tem.
O que isso significa para o mercado
A leitura comercial fica mais clara quando se olha o calendário. O 2.1 chega com corte de 50% no preço da imagem (US$ 0,0336 em 1K, contra US$ 0,067 do antecessor), com batch pela metade (US$ 0,0168) e sem camada gratuita. E chega com o antecessor agendado para desligar em 29 de outubro de 2026 — 23 dias depois do lançamento.
É uma migração orquestrada, e não espontânea: a Gemini Enterprise Platform recebeu o novo modelo em GA no mesmo dia, o que dá às empresas um caminho de destino antes do corte. Do outro lado do mercado, o concorrente direto da OpenAI também descontinua seu modelo de imagem legado em outubro, o que significa que desenvolvedores de vários fornecedores estão sendo empurrados para modelos novos ao mesmo tempo.
Sobre o tamanho da categoria, a ressalva metodológica se repete: estimativas para 2026 variam de US$ 4,8 bilhões a US$ 12–15 bilhões conforme o escopo do estudo, com um recorte restrito apontando US$ 0,51 bilhão. Citar um número único seria apresentar uma escolha metodológica como fato. E o histórico de adoção da linha, esse sim, tem números oficiais: 5 bilhões de imagens em menos de um mês em setembro de 2025 e 1 bilhão em 53 dias no Pro — nenhum deles, porém, do 2.1, que tem um dia de vida.
O que continua em aberto
- O escopo real da janela de contexto — 1M no card contra 131.072 na Enterprise: divergência entre dois documentos oficiais, sem explicação pública.
- Pesos e arquitetura detalhados: a documentação remete de card em card sem chegar a um detalhe técnico.
- Métricas de adoção do 2.1: só existirão a partir da teleconferência de resultados do terceiro trimestre da Alphabet, no fim de outubro, ou de um post comemorativo no padrão da linha.
- Disponibilidade de geração de pessoas: indisponível na Enterprise, e sem explicação pública sobre o motivo ou sobre prazo.
O encadeamento que a investigação sustenta é este: herdar a base de um modelo de linguagem multimodal deu ao 2.1 recursos que um gerador de imagem isolado não teria — raciocínio configurável, grounding em busca, contexto longo — e ao mesmo tempo expôs limites herdados, como a dificuldade com texto pequeno e a inconsistência de personagem. Foi essa mesma base que permitiu ao Google cortar o preço pela metade sem anunciar hardware novo, e distribuir o modelo em sete superfícies no primeiro dia. O que ainda não se sabe é se a preferência medida nos benchmarks próprios se traduz em uso — e essa resposta não está em nenhum model card.
Veja também
O Nano Banana 2.1 não exige hardware — e é isso que ele tem de mais interessante As TPUs que servem o modelo, a geração Ironwood e o acordo nuclear de 890 MW estão detalhados nesse texto.
Nano Banana 2.1: o Google corta o preço da imagem pela metade e dá 23 dias para a migração A guerra de preços da imagem via API, a tabela de concorrentes e a janela de migração forçada estão analisadas nesse texto.
Fontes
- Google DeepMind — model card do Nano Banana 2.1 — 06/10/2026 — base Flash, thinking, benchmarks, I/O, limitações, safety e C2PA.
- Google DeepMind — model card do Gemini 3.6 Flash — 07/2026 — arquitetura de referência e distribuição.
- Google — documentação do modelo 2.1 (API) — 06/10/2026 — identificador, limites, formatos, parâmetros suportados, GA na Enterprise.
- Google — pricing da Gemini API — consultado em 06/10/2026 — preço por token de entrada e saída, batch e grounding.
- Android Authority — 06/10/2026 — melhorias anunciadas e as sete superfícies de rollout.
- Unite.AI — 06/10/2026 — especificações da Enterprise e avaliações.
- The Decoder — 06/10/2026 — comparação prática com o Pro e a ressalva sobre o benchmark próprio.
Nota de produção
Conteúdo produzido a partir de um dossiê de investigação com fontes citadas, com apoio de assistência de IA e revisão editorial humana antes da publicação. Não houve acesso ao modelo, aos pesos ou a builds internos; nenhum recurso foi testado por esta redação. As limitações citadas são as declaradas pelo próprio Google no model card, e a divergência sobre a janela de contexto é registrada sem tentativa de resolvê-la.