I Tag Danbooru nei Modelli di Diffusione

Image

I Tag Danbooru nei Modelli di Diffusione

I professionisti della grafica (illustratori, concept artist, 3D artist) si trovano spesso a confrontarsi con il “prompting”. Se piattaforme come Midjourney o Nano Banana ci hanno abituato a descrizioni in linguaggio naturale (es. “Un cavaliere con armatura lucente che cammina in una foresta oscura, stile pittura a olio, illuminazione drammatica”), esiste un ecosistema parallelo, estremamente più tecnico e preciso, i modelli basati sui tag Danbooru. Ma cosa sono esattamente questi tag, e perché sono lo standard de facto per la generazione di illustrazioni di altissima qualità?

Che cos’è il sistema di Tag Danbooru?

Danbooru nasce originariamente come una imageboard (un archivio online di immagini, principalmente in stile anime e manga). La sua vera unicità, tuttavia, non risiede nelle immagini in sé, ma nel suo sistema di classificazione (folksonomy).

Negli anni, milioni di immagini sono state etichettate manualmente dagli utenti con una precisione maniacale. Ogni singolo elemento visibile in un’immagine ha un tag specifico, strutturato e inequivocabile. Non ci sono frasi, ma “token” separati da virgole, dove gli spazi sono sostituiti da underscore (es. blue_hair, looking_at_viewer, cowboy_shot).

Questo immenso database, perfettamente catalogato, è diventato il set di addestramento (dataset) ideale per i modelli di intelligenza artificiale. Invece di dover “indovinare” il significato di una frase complessa, l’AI impara un’associazione diretta e matematica tra un token specifico (il tag) e un elemento visivo.

I tag sono rigorosamente divisi in categorie:

  1. General (Generali): Elementi visivi, anatomia, vestiti (es. 1girl, pleated_skirt, twintails).
  2. Artist (Artisti): Lo stile specifico di un illustratore (es. greg_rutkowski, kyozi).
  3. Character (Personaggi): Personaggi specifici con i loro tratti distintivi.
  4. Copyright (Franchise): L’universo di provenienza (es. neon_genesis_evangelion).
  5. Meta / Quality: Tag tecnici che descrivono la qualità o l’inquadratura (es. masterpiece, highres, depth_of_field).

La Rivoluzione di Illustrious-XL

Per molto tempo, modelli come NovelAI o Waifu Diffusion hanno sfruttato questo sistema basandosi su architetture vecchie (come SD 1.5). La vera rivoluzione per i professionisti è arrivata con l’avvento dell’architettura SDXL (Stable Diffusion XL) e, in particolare, con il modello Illustrious-XL (noto anche nelle sue iterazioni come Wai-Illustrious) e i suoi potenti derivati.

A differenza dei modelli generici che cercano di capire l’inglese, Illustrious-XL è stato sottoposto a un fine-tuning (addestramento specifico) estremo proprio sul vocabolario Danbooru. Questo comporta tre vantaggi operativi fondamentali per un grafico:

  1. Aderenza al Prompt (Prompt Adherence) quasi assoluta: Se in un modello tradizionale chiedete “una ragazza con una scarpa rossa e una blu, che indossa una giacca aperta sopra una camicia bianca e ha una benda sull’occhio destro”, l’AI probabilmente confonderà i colori o fonderà i capi d’abbigliamento. Con Illustrious, usando la sintassi a tag (1girl, mismatched_footwear, red_shoe, blue_shoe, open_jacket, white_shirt, eyepatch), il modello isola i concetti e li renderizza esattamente dove devono stare, senza concept bleeding (sanguinamento dei concetti).
  2. Controllo dell’Inquadratura e della Composizione (Camera & Composition): Un professionista non si accontenta di “una bella immagine”, ma ha bisogno di dirigere la scena. I tag Danbooru offrono un controllo da direttore della fotografia. È possibile usare tag come: from_above / from_below (angolo di ripresa) dutch_angle (inquadratura inclinata) cowboy_shot (piano americano) depth_of_field, blurry_background, blurry_foreground (gestione della messa a fuoco).
  3. Modifica Modulare nei Workflow (ComfyUI): I professionisti che usano software a nodi come ComfyUI apprezzano la struttura a tag perché è modulare. È facile creare script o nodi che aggiungono, rimuovono o pesano determinati tag matematicamente (es. (red_eyes:1.2)) per alterare solo un dettaglio dell’immagine generata, mantenendo intatto il resto a patto che il seme resti costante.
Plaintext
SOURCE: https://civitai.com/

POSITIVE PROMPT: 

woman, solo, white hair, bangs, blue eyes, looking at viewer, reflection, eyelashes, eye focus, close-up, cloud, sky, collarbone, sunglasses, short hair, closed mouth, blunt bangs, portrait, mono chrome, glasses, spot color, blue theme, anime.

La costruzione di un prompt

Mettiamo che un concept artist debba generare un’illustrazione per una visual novel, una scena drammatica sotto la pioggia.

Approccio Midjourney (Natural Language):

“A beautiful dramatic anime illustration of a lonely girl standing in the rain at night, illuminated by neon lights, she is crying, wearing a futuristic school uniform, cinematic lighting, 8k resolution.”

Approccio Illustrious-XL / NoobAI (Tag Danbooru):

Positive: masterpiece, best quality, 1girl, solo, outdoors, night, raining, neon_lights, cinematic_lighting, crying, tears, futuristic_school_uniform, cyberpunk, looking_at_viewer, upper_body, wet_clothes, glowing_lights

Negative: bad quality, worst quality, sketch, signature, watermark, deformed, bad anatomy

Nel secondo caso, il professionista ha la certezza matematica che il modello richiamerà i cluster di pixel esatti associati al concetto di wet_clothes (vestiti bagnati aderenti) e tears (lacrime), fondendoli con cinematic_lighting.

Ecco una tabella sintetica con la suddivisione per tipologia di tag che si utilizza per organizzare i prompt:

CategoriaDescrizioneEsempio Pratico
Meta / QualityModificatori tecnici per forzare la qualità e lo stile generale.masterpiece, best quality, highres
CopyrightsL’universo, la serie o il franchise di provenienza.neon_genesis_evangelion, genshin_impact
CharactersIl nome del personaggio specifico.hatsune_miku, asuka_langley_soryu
ArtistsLo stile specifico di un illustratore (se richiesto).kyozi, greg_rutkowski
Body & AnatomyQuantità di soggetti e corporatura generale.1girl, tall, curvy
HairColore, lunghezza e acconciatura.blue_hair, twintails, ahoge
Eyes & FaceColore degli occhi, espressioni e dettagli del viso.red_eyes, smile, blush, tears
ClothingAbbigliamento e accessori indossati.school_uniform, pleated_skirt, armor
Pose & ActionPostura, posizionamento e azioni del soggetto.sitting, looking_at_viewer, holding_sword
Camera & CompositionInquadratura, prospettiva e gestione del focus.cowboy_shot, from_above, depth_of_field
Background / EnvL’ambiente circostante e lo scenario.outdoors, night, cityscape, rain
Objects & PropsOggetti fisici separati o impugnati nella scena.sword, umbrella, car, cup
Lighting & MoodDirezione della luce e atmosfera generale.cinematic_lighting, neon_lights, dark
Sensitive / NSFWTag per definire l’esposizione o l’anatomia esplicita.general, sensitive, nsfw, explicit
Negative (Common)Tag di difetti da inserire nel Negative Prompt.worst quality, bad anatomy, sketch
Plaintext
SOURCE: https://civitai.com/

POSITIVE PROMPT: 

Smooth_QualityPlus, refined stylized anime realism, (edge polished anime realism), (ultra-detailed anime shading), vibrant anime illustration, ambient occlusion pass, UHD quality detail BREAK aidmafluxpro1.1, fine contact shadow layering, subtle shading falloff, light-adaptive shadow diffusion, crisp edge detailing, vivid cinematic lighting, crisp shadowplay, colorful light scatter, delicate surface reflection mapping, realistic subsurface light bounce, directional specular diffusion, (masterpiece, refined detail, highly detailed), polished details, refined textures, rich color depth BREAK uhd skin details, refined skin texture BREAK playful fair-skinned anime girl with vibrant pink bob cut with layered hair, side part, ultra detailed anime face, ultra detailed anime eyes, vibrant blue eyes, sparkling irises, curious expression, slight smile, complex reflective pupils, precise iris patterning, catchlight emphasis, fine eyelash definition, micro eye shadowing, corneal light refraction, smooth facial skin detailing, refined lip detailing, perfect slender body, very large breasts BREAK casual streetwear outfit, light blue bomber jacket with fitted white tank top underneath, ribbon choker, pastel pink pleated skirt, soft fabric sheen, intricate fabric weave, fine layered fabric detail, cloth bunching realism, rich realistic fabric fold, detailed fabric stitching BREAK hidden walled garden, stone courtyard with ivy-covered walls, arched wrought-iron gate entwined with roses, creeping vines and scattered flowerpots, golden shafts of light through canopy leaves, ornamental stone surface detail, intricate wrought-iron detailing, floral petal texture fidelity, leaf texture fidelity, luminous foliage highlights, ornamental surface texture, ambient light diffusion, radiant sunbeam accents, delicate wing texture fidelity, <lora:Smooth_Booster_v3:1>, <lora:Smooth_Lighting_Enhancer:0.5>, <lora:aidmaFLuxPro1.1_v0.3_IL:0.5>.

Sintassi Ponderata (Weighted Syntax / A1111 Style)

Questo formato utilizza parentesi (tonde o quadre) e valori numerici per alterare matematicamente l’attenzione che l’AI deve dedicare a uno specifico concetto, indipendentemente dalla sua posizione nel prompt.

Come funziona il peso: Si utilizza la formattazione (tag:valore). Un valore superiore a 1.0 aumenta l’importanza del tag, mentre un valore inferiore a 1.0 la diminuisce.

Esempi:

  • (red eyes:1.4): Forza l’AI a prestare molta più attenzione al colore degli occhi.
  • (school uniform:0.8): Riduce l’impatto dell’uniforme scolastica, utile se l’outfit sta sovrascrivendo altri dettagli.
  • (((blue hair))): Un metodo alternativo rapido (molto usato su NovelAI o vecchie versioni A1111) dove ogni parentesi aggiunge un moltiplicatore standard (solitamente x1.1).

La sintassi ponderata, è essenziale quando l’AI “ignora” un dettaglio minore (es. un piccolo accessorio come hair_flower) o quando un tag predominante (es. fire o water) inizia a “sporcare” l’intera immagine alterandone l’illuminazione. Invece di riscrivere l’intero prompt, puoi semplicemente alzare o abbassare il volume di quel singolo elemento.

CaratteristicaDanbooru PuroWeighted Syntax
Sintassitag, tag, tag(tag:1.5), (tag:0.7)
GerarchiaBasata unicamente sulla posizione (da sinistra a destra).Indipendente dalla posizione, basata sul moltiplicatore.
InterferenzaBassa. L’AI bilancia i concetti in modo organico.Alta. Pesi eccessivi (es. >1.5) possono “friggere” l’immagine o distorcere l’anatomia.
Scopo PrincipaleDescrivere la scena in modo naturale e pulito.Correggere difetti, forzare dettagli ignorati o smorzare elementi troppo forti.

I modelli ideali (come Illustrious SDXL, NoobAI o derivati) ottimizzati per lavorare al meglio con questa specifica sintassi a tag si possono trovare, esplorare e scaricare su piattaforme dedicate come Civitai, Civitai Red, CivArchive, Tensor.art, Hugging Face e altre community o repository simili dedicati all’AI generativa.

Pose

Per controllare le pose ci sono due strade, e vanno usate insieme: i tag Danbooru servono a dire che tipo di posa vuoi, mentre strumenti come ControlNet/OpenPose servono a dire esattamente dove devono stare testa, braccia, busto e gambe. Il tag descrive un’intenzione, non disegna uno scheletro. sitting dice “seduta”, ma non decide con precisione se una gamba è avanti, se il busto è ruotato o se il braccio passa davanti al corpo.

La formula pratica è questa:

Prompt = intenzione della posa
OpenPose / ControlNet = struttura fisica della posa

Una posa controllata solo con tag potrebbe essere:

masterpiece, best quality, 1girl, solo, full_body, standing, hand_on_hip, looking_at_viewer, dynamic_pose, school_uniform, outdoors, sunlight

Funziona, ma resta generica, una posa più diretta sarà:

masterpiece, best quality, 1girl, solo, full_body, crouching, one_knee, hand_on_ground, looking_at_viewer, dynamic_angle, foreshortening

Qui il modello capisce meglio che vuoi una posa bassa, dinamica, con una mano a terra. Però può ancora sbagliare mani, ginocchia o prospettiva.

Plaintext
SOURCE: https://civitai.com/

POSITIVE PROMPT:

XUER guangying,<lora:绪儿 光影滤镜 XUER guangying:0.8>,
score_9,score_8_up,score_7_up,score_6_up,score_5_up,score_4_up,
XUER guangying,1girl,solo,long hair,looking at viewer,skirt,black hair,red eyes,holding,twintails,school uniform,weapon,pleated skirt,glasses,serafuku,socks,sword,holding weapon,kneehighs,blood,holding sword,squatting,katana,sheath,red-framed eyewear,black serafuku,fighting stance.

Per una posa davvero precisa devi usare ControlNet con OpenPose. ControlNet serve proprio ad aggiungere una condizione visiva al modello di diffusione; OpenPose rileva o usa una mappa scheletrica con punti chiave del corpo, come gomiti, polsi, ginocchia e testa. In questo modo l’immagine generata segue la struttura della posa invece di inventarla solo dal testo. La documentazione e le guide su ControlNet descrivono proprio questo uso, OpenPose estrae i keypoint umani e li passa al modello come condizionamento aggiuntivo

Il workflow ideale è: prima scegli una reference pose, anche una foto o un’immagine 3D. Poi estrai lo scheletro OpenPose. A quel punto scrivi il prompt Danbooru per definire personaggio, vestiti, stile, ambiente e atmosfera. Il modello seguirà la posa della reference, ma trasformerà il soggetto secondo i tuoi tag.

IMPORTANTE: non sovraccaricare il prompt di pose contraddittorie. Se scrivi insieme standing, sitting, kneeling, jumping, il modello non sceglie in modo intelligente: mescola. Meglio una posa principale, due o tre dettagli anatomici e poi l’inquadratura.

Quando passiamo a contenuti espliciti su modelli come Illustrious SDXL, il modo in cui strutturiamo il prompt cambia in modo significativo. Questi modelli sono stati addestrati sul database Danbooru, dove l’anatomia NSFW e le interazioni fisiche sono catalogate con estrema pignoleria e rigore meccanico.

L’Intelligenza Artificiale non comprende l’erotismo o i sottintesi romanzati, capisce solo la meccanica e il posizionamento spaziale. Se desideri una scena esplicita, devi descrivere esattamente l’interazione tra i corpi usando i tag anatomici corretti.

Un’altissima percentuale delle immagini NSFW nel dataset originale giapponese è censurata per questioni legali. Se non gestisci questo aspetto nel prompt negativo, il modello genererà spontaneamente barre nere, pixel o nebbia per coprire i dettagli.

“Trigger Words” (Tag di Attivazione) e LoRA

Quasi tutti i LoRA (specialmente quelli dedicati a personaggi o outfit specifici) vengono addestrati associando i concetti a una o più Trigger Words.

Devi inserire obbligatoriamente queste parole chiave (spesso all’inizio o subito dopo i tag di qualità). Se il LoRA del personaggio Hatsune Miku richiede il trigger hatsune miku (vocaloid), questo tag diventa la priorità assoluta. Le trigger words sono sempre indicate dal creatore del LoRA nella pagina di download (es. su Civitai).

Quando usi un LoRA per un personaggio specifico, il modello “sa” già come è fatto. L’uso dei tag Danbooru cambia in:

  • Rinforzo: Inserire i tag base (es. blue hair, twin tails, blue eyes, detached sleeves) aiuta il LoRA a esprimersi al 100% della sua forza, specialmente se il peso del LoRA è tenuto basso (es. 0.6).
  • Semplificazione: Se il LoRA è molto “cotto” (overtrained), scrivere troppi tag descrittivi del suo aspetto base può “friggere” l’immagine o renderla innaturale. In questi casi, il prompt si snellisce molto: basta la Trigger Word, l’azione e l’ambiente.
  • Conflitti: Qui diventa cruciale la Sintassi Ponderata (Weighted Syntax). Se il LoRA forza i capelli blu, ma tu li vuoi rossi, un semplice red hair verrà ignorato. Dovrai usare (red hair:1.4) per forzare l’AI a deviare dall’addestramento del LoRA. Al contempo, dovrai mettere nei negativi i tratti originali che vuoi sopprimere.

LoRA in pratica

Ecco una tabella di combo WAI-Illustrious + LoRA pensata per uso pratico, cioè prompt anime/illustration con controllo su stile, personaggio, posa e resa finale. Non la intendo come classifica assoluta, perché su Civitai/TensorArt i LoRA cambiano continuamente, ma come schema di combinazioni solide.

Il miglior workflow non è accumulare LoRA, ma farli lavorare in gerarchia. Prima viene il checkpoint, poi il LoRA del personaggio, poi lo stile, poi eventuali correzioni leggere. Se metti tutto a peso alto, l’immagine non diventa più ricca, diventa più confusa.

Tipo LoRAPeso sicuroPeso forteRischio
Character LoRA0.6–0.80.9–1.0Personaggio rigido, posa meno libera
Style LoRA0.3–0.60.7–0.9Lo stile sovrascrive volto e outfit
Outfit LoRA0.5–0.80.9–1.0Vestiti fusi al corpo o troppo vincolanti
Pose LoRA0.4–0.70.8–1.0Anatomia instabile
Detail LoRA0.2–0.50.6–0.8Immagine troppo nitida, pelle artificiale
Background LoRA0.3–0.60.7–0.9Il fondale domina il soggetto
Face/Eye LoRA0.2–0.50.6–0.8Occhi deformati o espressioni innaturali
ObiettivoCombo consigliataPeso LoRA indicativoPrompt baseQuando usarlaAttenzione
Illustrazione anime pulitaWAI-Illustrious + detail/quality LoRA leggero0.3–0.6masterpiece, best quality, 1girl, solo, clean lineart, detailed eyes, soft lightingPer immagini pulite, commerciali, character artSe il LoRA detail è troppo alto, pelle e capelli diventano “croccanti”
Character design professionaleWAI-Illustrious + character LoRA + outfit tagsCharacter 0.6–0.9masterpiece, best quality, 1girl, full_body, standing, character_trigger, detailed outfitQuando vuoi mantenere un personaggio coerenteSe il LoRA è overtrained, riduci i tag descrittivi del personaggio
Stile visual novelWAI-Illustrious + soft anime style LoRA + background LoRAStyle 0.4–0.7, BG 0.3–0.51girl, upper_body, looking_at_viewer, school_uniform, classroom, soft lighting, visual novel styleDialoghi, scene narrative, bust shotTroppi LoRA insieme appiattiscono l’espressività
Concept art fantasyWAI-Illustrious + fantasy outfit LoRA + cinematic lightingOutfit 0.5–0.81girl, armor, cape, holding_sword, ruins, dramatic_lighting, from_belowGuerrieri, maghi, personaggi da giocoIl LoRA outfit può “mangiare” anatomia e posa
Cyberpunk animeWAI-Illustrious + cyberpunk LoRA + neon lighting tags0.5–0.81girl, solo, cyberpunk, cityscape, night, neon_lights, rain, wet_clothes, cinematic_lightingScene urbane, poster, visual novel sci-fiNeon e pioggia possono sporcare troppo l’immagine
Pose dinamiche/actionWAI-Illustrious + pose/action LoRA + OpenPosePose LoRA 0.4–0.7full_body, dynamic_pose, running, holding_sword, foreshortening, motion_blurCombattimenti, salto, corsa, prospettive fortiPer pose precise usa anche ControlNet/OpenPose
Ritratto anime premiumWAI-Illustrious + face detail LoRA + eye detail LoRAFace 0.3–0.5, Eyes 0.3–0.6portrait, close-up, detailed eyes, soft smile, blush, depth_of_fieldAvatar, cover, profili personaggioEvita pesi alti: occhi troppo grandi o innaturali
Moda / outfit designWAI-Illustrious + fashion LoRA + fabric/detail tags0.5–0.81girl, full_body, elegant dress, high heels, fashion pose, studio backgroundAbiti, costumi, skin per personaggiUsa full_body, altrimenti il modello taglia scarpe e gambe
Background illustratoWAI-Illustrious + background/environment LoRA0.3–0.6solo, outdoors, forest, sunlight, flowers, depth_of_field, wide_shotPaesaggi anime, ambientazioni, fondaliSe il soggetto è importante, tieni il LoRA background basso
Stile manga / lineartWAI-Illustrious + manga/lineart LoRA0.5–0.8monochrome, manga style, screentones, clean lineart, expressive faceTavole, sketch puliti, copertine mangaAlcuni LoRA lineart riducono colore e volume
Poster cinematograficoWAI-Illustrious + cinematic LoRA + lighting tags0.4–0.7dramatic_lighting, backlighting, rim_light, dutch_angle, depth_of_field, seriousCover, splash art, key visualNon usare troppi tag luce insieme
Coerenza personaggio + stileWAI-Illustrious + character LoRA + style LoRACharacter 0.6–0.8, Style 0.3–0.5character_trigger, 1girl, solo, outfit tags, style tags, clean backgroundQuando vuoi un personaggio in uno stile specificoIl character LoRA deve dominare, lo style LoRA deve accompagnare
Plaintext
SOURCE: https://civitai.com/

POSITIVE PROMPT: 

Masterpiece, best quality, amazing quality, newest, very aesthetic, scenery, 8k, good anatomy, good shading, ultra detailed, refined details, high resolution, HD, masterwork, p1ge0n666_illu.

1girl, solo, abstract, Chinese attire, female focus, asian, multicolored hair, aqua hair, hair slicked back, long hair, makeup, animal print, eye implant, chain necklace, multiple necklaces, collared shirt, hair ornament, jewelry, blue eyes, glowing eyes, multicolored eyes, aqua eyeshadow, thick eyebrows, v-shaped eyebrows, wavy eyes, wide-eyed, looking at viewer, earrings, ((hoop earrings:1.3)), piercing, ((face piercing:1.2)), (lip piercing:1.2), green pants, jacket, layered shirt, leopard print, light frown, long sleeves, open shirt, shoes, psychedelic, lucky clouds accents, stylish design, epic character design, dynamic pose, mid-air, knee to chest, hunched over, knee up, from above, psychedelic pattern, motion blur, Fisheye, dutch angle, depth of field, foreshortening, blurry edges, red background, yellow background, two-tone background, abrstact background, vignetting, static, matrix, bold, geometric, pixelate, detailed background.

Per i professionisti della grafica e dell’illustrazione, padroneggiare il vocabolario Danbooru non significa solo imparare una nuova lingua, ma acquisire un livello di controllo “sintattico” sull’immagine generata che il linguaggio naturale non può ancora offrire. Modelli come Illustrious-XL e NoobAI non sono solo generatori di immagini, ma veri e propri “motori di rendering semantico” che rispondono in modo prevedibile e chirurgico agli input dell’utente.

Comprendere i CSV di queste categorizzazioni (anatomia, vestiario, pose, illuminazione) è il primo passo per smettere di “sperare” che l’AI capisca, e iniziare a “programmare” visivamente la propria arte.

Se l’articolo ti è piaciuto restiamo in contatto su linkedin a https://www.linkedin.com/in/andreatonin/

Releated Posts

La mia chat AI locale con Python e Gemma — Parte 4: salvare le conversazioni senza database

Questa quarta parte racconta come ho aggiunto il salvataggio. Il codice è banal, è JSON su disco, non…

DiByAndrea Tonin Ago 5, 2026

La mia chat AI locale con Python e Gemma — Parte 3: i prompt di sistema multipli

Questa terza parte racconta la prima funzionalità vera costruita sopra quel refactoring: la possibilità di scegliere, prima di…

DiByAndrea Tonin Ago 5, 2026

La mia chat AI locale con Python e Gemma — Parte 2: refactoring

Quando chiedi a Claude Code di generare un’applicazione, di solito ottieni qualcosa di funzionante. Ma c’è un “ma”……

DiByAndrea Tonin Ago 4, 2026

Gamescom 2026: il futuro dei videogiochi passa dal lavoro degli sviluppatori

Dal 26 al 30 agosto 2026, Colonia tornerà a essere uno dei principali punti d’incontro dell’industria videoludica internazionale.…

DiByAndrea Tonin Ago 3, 2026