O problema das imagens medievais geradas por IA
Como criar imagem idade média com qualidade
A maioria dos geradores de imagem falha feio quando você pede algo medieval. As armas ficam com aspecto moderno demais, as armaduras parecem fantasia de convenção, e os rostos têm aquela aparência plástica que todo mundo conhece. Eu passei uns três meses testando configurações antes de conseguir resultados que não parecessem material de curso de Introdução a Arte Digital. O segredo não é o modelo que você usa, mas sim como você estrutura o prompt. Comece definindo o tipo de imagem que você quer como referência histórica, não como fantasia. Palavras como "iluminura do século XIV", "têmpera sobre madeira", "manuscrito medieval" ou "pintura a óleo estilo primitivo flamengo" produzem resultados muito mais críveis do que simplesmente escrever "idade média". A IA tem treinado com milhares de reproduções artísticas desses períodos, então ela sabe o que buscar quando esses termos aparecem.
Eu recomendo começar com Stable Diffusion 1.5 ou 2.1 rodando localmente, se tiver uma GPU decente. Models como Realistic Vision ou DreamShaper funcionam bem quando combinados com prompts adequados. Se você não consegue rodar localmente, Leonardo.ai e Playground AI são opções razoáveis na nuvem, embora ambas tenham limitações na fidelidade histórica que vou detalhar mais abaixo. Um problema que eu encontrei repetidamente é que os geradores tendem a masculinizar tudo. Quando você pede "cavaleiro", mesmo especificando "mulher", o resultado muitas vezes acaba sendo ambíguo ou claramente masculino. Minha solução foi adicionar prompts negativos agressivos como "male, masculine features, modern clothing" e usar weighting com parênteses para dar ênfase a "female knight armor". O peso padrão é (palavra:1.0), e eu costumo subir para (palavra:1.3) nos atributos que quero preservar.
Outro ponto que poucas pessoas mencionam: a iluminação. Imagens medievais têm iluminação muito específica porque as cenas eram pintadas em interiores com luz de vela ou janelas estreitas. Adicionar "chiaroscuro lighting", "warm candlelight", "single source light from left window" ao prompt faz uma diferença absurda na atmosfera. Sem isso, as imagens ficam planas e parecem fotos atuais com filtros sépia aplicados. Para arquitetura e cenários, o desafio é maior. A IA mistura estilos românico, gótico e renascentista sem distinção. Se você precisa de um castelo especificamente românico do século XII, adicione "roman arches, thick stone walls, small windows, crenellated parapet". Para gótico posterior, "pointed arches, flying buttresses, rose window, vertical emphasis". A diferença é grande e o modelo entende quando você especifica.
O uso de ControlNet com um esboço básico pode economizar horas de iteração. Eu costumo desenhar uma composição simples no papel, digitalizar e usar como guia. Isso resolve o problema da pose e enquadramento, permitindo que você foque apenas nos detalhes texturais e de iluminação. Sem ControlNet, você basicamente joga dados e torce para acertar a postura dos personagens na primeira tentativa. Aqui estão algumas configurações práticas que eu recomendo como ponto de partida:
Resolução: 768x1024 ou 1024x768 para retratos verticais, 1024x576 para cenas amplas de castelos e paisagens. Resolução quadrada (1024x1024) funciona mas é menos flexível para composição. Sampler: DPM++ 2M Karras. Ele produce texturas mais consistentes do que Euler afix ou outros samplers comuns, especialmente em superfícies de pedra e metal.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Steps: 30 a 40. Menos que 25 gera artefatos visíveis nas bordas e nas texturas. Mais que 40 raramente melhora o resultado e só aumenta o tempo de geração. Scheduler: Karras. Combine com CFG scale entre 5 e 7. Acima de 8 as imagens começam a ficar super saturadas e com contraste artificial, o que destrói a aparência de pintura antiga.
O prompt ideal segue esta estrutura básica: descrição da cena, período artístico de referência, iluminação, detalhes de textura e materiais, e por fim restrições negativas. Exemplo completo: "medieval manuscript illumination scene, 14th century Flemish primitive painting style, warm candlelight from single window, detailed stone architecture with Roman arches, weathered iron armor with realistic scratches and patina, oil texture on wood panel, --neg male modern clothing plastic skin." Agora o lado ruim que ninguém gosta de ouvir. Geradores de imagem baseados em IA simplesmente não conseguem produzir precisão histórica consistente. Uniformes, armas, arquitetura e vestimentas variaram enormemente entre regiões e décadas durante a Idade Média, e o modelo não discrimina essas diferenças. O que você vê é sempre uma média estatística do que a internet chama genericamente de "medieval". Isso significa que suas imagens podem parecer medievalmente corretas para um leigo, mas um historiador vai identificar erros imediatamente.
Se você precisa de precisão para um projeto acadêmico, jogo histórico ou publicação, o caminho é usar a IA como base e refinar manualmente em software como Krita ou Photoshop, ou combinar com referências de museus e acervos digitais. O Louvre, a British Library e a Biblioteca Nacional de Portugal têm manuscritos em alta resolução gratuitos online que servem como referência direta. Outra limitação importante: a IA tem dificuldade extrema com texto. Se você precisa de letras, inscrições ou pergaminhos com conteúdo legível, não confie no gerador. Gere a imagem sem texto e adicione depois com uma fonte appropriate. Fontes como "UnifrakturCook" ou "MedievalSharp" no Google Fonts resolvem esse problema rapidamente.
Para quem quer um caminho mais rápido sem configurar nada localmente, o site Leonardo.ai oferece templates específicos para arte medieval que já vêm com prompts otimizados. A versão gratuita dá 25 créditos por dia, o que é suficiente para alguns testes mas não para produção em série. O resultado é decente para uso casual ou redes sociais, mas não espere qualidade profissional sem ajustar os parâmetros manualmente. Se o seu foco é geração em massa para um projeto maior, considere treinar um LoRA com imagens de manuscritos e pinturas medievais reais. Com cerca de 15 a 20 referências bem selecionadas, é possível criar um adapter que muda completamente a estética do modelo base. O treinamento leva algumas horas em uma GPU como uma RTX 3090, mas o resultado final é muito mais consistente do que apenas ajustar prompts.
O processo todo, do primeiro prompt ao resultado final refinado, leva em média 20 a 45 minutos dependendo da complexidade da cena. Uma cena simples com um único personagem leva cerca de 15 minutos. Paisagens arquitetônicas com múltiplos elementos podem levar até uma hora de iteração porque a IA tende a criar formas impossíveis em estruturas grandes.