tech · mercado · hardware · software

Início › Software › Nano Banana 2.1: o que muda quando a imagem vira um "head" de um modelo de texto

Software Série Nano Banana 2.1 07/10/2026

Nano Banana 2.1: o que muda quando a imagem vira um "head" de um modelo de texto

o novo modelo de imagem do Google não é um gerador de imagens — é um modelo de linguagem multimodal que devolve pixels, e é essa arquitetura que explica tanto os recursos novos quanto os limites que a própria empresa admite.

Nano Banana 2.1: o que muda quando a imagem vira um "head" de um modelo de texto

o novo modelo de imagem do Google não é um gerador de imagens — é um modelo de linguagem multimodal que devolve pixels, e é essa arquitetura que explica tanto os recursos novos quanto os limites que a própria empresa admite.

O que o modelo é, por dentro

O Nano Banana 2.1, lançado em 6 de outubro de 2026, é um head de imagem sobre o Gemini 3.6 Flash. A frase parece jargão, mas descreve a mudança de categoria: o que o usuário vê é um gerador de imagens; o que existe por baixo é um modelo multimodal nativo da família Gemini 3, que entende texto e imagem (o model card cita até 1M de tokens de contexto na entrada), raciocina em níveis configuráveis e devolve imagem mais texto.

A herança tem data: o cutoff de conhecimento é março de 2026, com domínios limitados a janeiro de 2025. E a linhagem é direta — o 2.1 substitui o Nano Banana 2 (Gemini 3.1 Flash Image), enquanto o Nano Banana Pro, sobre o Gemini 3 Pro, segue como topo de qualidade.

A alavanca mais interessante: thinking configurável

Entre os parâmetros que a API aceita, um merece destaque por razão econômica e não estética: o thinking configurável, em três níveis — minimal, medium (padrão) e high.

O próprio Google mede a diferença: o modelo com thinking alcança Elo 1050 em preferência geral, contra 1015 sem. Traduzindo para quem paga a conta: a mesma API permite gastar menos compute quando o caso não exige raciocínio profundo e mais compute quando exige. É a alavanca visível de uma relação que, do lado do servidor, é puramente física — mais thinking significa mais cálculo nos pods de TPU, com a mesma chamada de API.

O que entrou e o que continua faltando

As melhorias anunciadas são específicas, e vale listá-las para que a promessa fique verificável:

  • melhor qualidade e realismo nas três resoluções (1K, 2K e 4K);
  • fim dos artefatos de emenda (tiling) em panoramas nas proporções 1:4, 4:1, 1:8 e 8:1, em 2K e 4K;
  • melhor desempenho em texto dentro da imagem e infográficos;
  • fusão de múltiplas imagens: até 14 referências, com consistência de até 4 personagens e 10 objetos;
  • grounding em Web e Image Search.

A especificação de I/O é igualmente concreta: 1.120 tokens por imagem de entrada; saída de 1.120 tokens para imagem em 1K e 1.680 em 2K; imagem final em 1K, 2K ou 4K (padrão 1K); e texto de saída de até 64K. Formatos de saída: PNG, JPEG, WebP, HEIC e HEIF.

Agora a parte que costuma ser omitida em lançamentos: as limitações admitidas no model card. O Google reconhece texto pequeno borrado em 1K e problemas com parágrafos longos; consistência de personagem imperfeita; persistência parcial em edição com máscara; confusão espacial entre esquerda e direita; desempenho limitado em 3D e em factualidade; e timeouts ocasionais. Também registra que geração de pessoas está indisponível na Enterprise.

Isso não é um detalhe de rodapé. É o que permite ao leitor calibrar a promessa — e a diferença entre um lançamento que se apresenta como resolvido e um que declara onde falha.

Onde ele roda e o que não é suportado

A distribuição cobre sete superfícies — app Gemini, AI Mode na Busca, AI Studio, Gemini API, Flow, Stitch e Google Ads — mais a Gemini Enterprise Platform, onde o modelo entrou em disponibilidade geral no mesmo dia, sob o identificador `gemini-nano-banana-2-1`.

Nos parâmetros de plataforma, há uma lista de suportados e outra de recusados que diz bastante sobre o tipo de modelo. A API aceita reasoning, system instructions, context caching implícito, token counting, grounding, provisioned throughput e batch. E não aceita seed, topK, topP, temperature nem logprobs — retornando erro de API. Ou seja: controles clássicos de amostragem estocástica simplesmente não existem nessa interface. A variação é gerenciada por outro caminho, e não é possível fixar uma semente para reproduzir uma imagem exatamente.

Há também uma dependência que vale nomear, porque é dela que vem parte da credibilidade do produto: o C2PA (Content Credentials), o padrão de proveniência que marca a origem do conteúdo gerado. Em um mercado em que a autenticidade visual virou questão prática, é um recurso de confiança, não de qualidade de imagem.

Uma divergência que o Google não explicou

Vale registrar uma inconsistência entre dois documentos oficiais do próprio Google, porque ela não é uma lacuna de investigação — é uma contradição documentada.

O model card do Nano Banana 2.1 informa até 1M de tokens de contexto na entrada. Já a documentação da Enterprise Platform lista 131.072 tokens de entrada e 32.768 de saída. A hipótese mais provável é diferença de canal — a API completa contra a versão corporativa em GA —, mas nenhuma fonte explica a diferença, e as duas são oficiais.

Há ainda uma recursão incômoda na cadeia de documentação: o model card do 2.1 remete ao card do Gemini 3.6 Flash, que por sua vez remete ao do 3.5. Os pesos e a arquitetura detalhada nunca chegam a um documento público.

O que o software revela sobre o hardware

A relação entre as duas camadas aqui é de subordinação total, e o próprio model card assume isso: não há hardware ou software exigido do usuário. O modelo só roda em TPUs do Google, e o usuário nunca vê essa camada.

O thinking configurável é a única fresta visível dessa relação. Cada nível a mais significa mais cálculo por chamada no mesmo endpoint — e é o que permite ao Google vender, na mesma API, uma opção barata e uma opção cara, ajustando o custo por imagem sem tocar no preço de tabela. Um modelo de imagem tradicional não teria essa alavanca; um head de um modelo de linguagem tem.

O que isso significa para o mercado

A leitura comercial fica mais clara quando se olha o calendário. O 2.1 chega com corte de 50% no preço da imagem (US$ 0,0336 em 1K, contra US$ 0,067 do antecessor), com batch pela metade (US$ 0,0168) e sem camada gratuita. E chega com o antecessor agendado para desligar em 29 de outubro de 2026 — 23 dias depois do lançamento.

É uma migração orquestrada, e não espontânea: a Gemini Enterprise Platform recebeu o novo modelo em GA no mesmo dia, o que dá às empresas um caminho de destino antes do corte. Do outro lado do mercado, o concorrente direto da OpenAI também descontinua seu modelo de imagem legado em outubro, o que significa que desenvolvedores de vários fornecedores estão sendo empurrados para modelos novos ao mesmo tempo.

Sobre o tamanho da categoria, a ressalva metodológica se repete: estimativas para 2026 variam de US$ 4,8 bilhões a US$ 12–15 bilhões conforme o escopo do estudo, com um recorte restrito apontando US$ 0,51 bilhão. Citar um número único seria apresentar uma escolha metodológica como fato. E o histórico de adoção da linha, esse sim, tem números oficiais: 5 bilhões de imagens em menos de um mês em setembro de 2025 e 1 bilhão em 53 dias no Pro — nenhum deles, porém, do 2.1, que tem um dia de vida.

O que continua em aberto

  • O escopo real da janela de contexto — 1M no card contra 131.072 na Enterprise: divergência entre dois documentos oficiais, sem explicação pública.
  • Pesos e arquitetura detalhados: a documentação remete de card em card sem chegar a um detalhe técnico.
  • Métricas de adoção do 2.1: só existirão a partir da teleconferência de resultados do terceiro trimestre da Alphabet, no fim de outubro, ou de um post comemorativo no padrão da linha.
  • Disponibilidade de geração de pessoas: indisponível na Enterprise, e sem explicação pública sobre o motivo ou sobre prazo.

O encadeamento que a investigação sustenta é este: herdar a base de um modelo de linguagem multimodal deu ao 2.1 recursos que um gerador de imagem isolado não teria — raciocínio configurável, grounding em busca, contexto longo — e ao mesmo tempo expôs limites herdados, como a dificuldade com texto pequeno e a inconsistência de personagem. Foi essa mesma base que permitiu ao Google cortar o preço pela metade sem anunciar hardware novo, e distribuir o modelo em sete superfícies no primeiro dia. O que ainda não se sabe é se a preferência medida nos benchmarks próprios se traduz em uso — e essa resposta não está em nenhum model card.

Veja também

O Nano Banana 2.1 não exige hardware — e é isso que ele tem de mais interessante As TPUs que servem o modelo, a geração Ironwood e o acordo nuclear de 890 MW estão detalhados nesse texto.

Nano Banana 2.1: o Google corta o preço da imagem pela metade e dá 23 dias para a migração A guerra de preços da imagem via API, a tabela de concorrentes e a janela de migração forçada estão analisadas nesse texto.

Fontes

  • Google DeepMind — model card do Nano Banana 2.1 — 06/10/2026 — base Flash, thinking, benchmarks, I/O, limitações, safety e C2PA.
  • Google DeepMind — model card do Gemini 3.6 Flash — 07/2026 — arquitetura de referência e distribuição.
  • Google — documentação do modelo 2.1 (API) — 06/10/2026 — identificador, limites, formatos, parâmetros suportados, GA na Enterprise.
  • Google — pricing da Gemini API — consultado em 06/10/2026 — preço por token de entrada e saída, batch e grounding.
  • Android Authority — 06/10/2026 — melhorias anunciadas e as sete superfícies de rollout.
  • Unite.AI — 06/10/2026 — especificações da Enterprise e avaliações.
  • The Decoder — 06/10/2026 — comparação prática com o Pro e a ressalva sobre o benchmark próprio.

Nota de produção

Conteúdo produzido a partir de um dossiê de investigação com fontes citadas, com apoio de assistência de IA e revisão editorial humana antes da publicação. Não houve acesso ao modelo, aos pesos ou a builds internos; nenhum recurso foi testado por esta redação. As limitações citadas são as declaradas pelo próprio Google no model card, e a divergência sobre a janela de contexto é registrada sem tentativa de resolvê-la.

Explore também