NVIDIA před časem představila platformu NIM a s ní i AI Blueprints – připravené pracovní postupy pro nasazení umělé inteligence. Usnadňují zprovoznění modelů pro AI i bez znalosti programování, lokálně či v cloudu. Na blueprintu, který propojuje Blender, ComfyUI a modely FLUX v nástroj, s nímž budete mít lepší kontrolu nad generováním obrázků pomocí AI, si celý postup vyzkoušíme a přiblížíme si, jak blueprinty fungují a jak se s nimi pracuje.
Následuje už spuštění Blenderu. V něm v hlavní nabídce otevřete Edit>Preferences a přejděte do sekce Add-ons. Tady musíte aktivovat doplňek ComfyUI a do nastavení vložit cesty k adresáři s ComfyUI a ke vloženému Pythonu, který je v obdobném umístění.
V mém případě jde o cesty:
c:\blender-to-ai\3d-guided-genai-rtx\ComfyUI_windows_portable\ComfyUI\ c:\blender-to-ai\3d-guided-genai-rtx\ComfyUI_windows_portable\python_embeded\
Pak už můžete otevřít vzorovou scénu, kterou instalátor umístil do složky Dokumenty\Blender.
Celá pipeline se spouští stiskem tlačítka Launch/Connect to ComfyUI z paneulu ComfyUI Connector. Před spuštěním je dobré zkontrolovat, zda jsou v pořádku cesty ke ComfyUI a k Pythonu.
Ještě než se o to pokusíte, určitě projděte uzly Input Image a SaveImage a v grafu pro ComfyUI a v nich upravte cesty – ve výchozím modelu vedou do složek v profilu s uživatelským jménem NV, který nejspíš ve vašem PC nebude existovat. Upravte je na cesty, které existují. Modelovou scénu uložte, zavřete a znovu otevřete.
Za ideálních okolností by tady návod mohl končit a dál už by zbývalo jen inicializace modelů a hraní s Blenderem, textovým propmtem a nastavením modelu.
Ale nešlo to ani zdaleka tak hladce. Vývoj kolem AI je překotný a pár měsíců staré návody už nemusejí fungovat. Následovala dlouhá konverzace s chatGPT, doptávání, hlubší zkoumání repozitáře a úpravy skriptů. Při celém procesu už jsem se nechal vést za ručičku.
Při prvním spuštění skriptu si určitě rovnou otevřete i výpis z konzole pro debug. V anglické verzi blenderu je v nabídce Window>Toggle System Console, v české je to dost nesrozumitelně, ale umístění a ikona se shodují.

Skritp začal intenzivně pracovat. ale skončil chybovou hláškou.
A v této fázi už jsem se změnil spíše na prostředníka mezi ChatGPT a výstupy z chybových logů modelu ComfyUI. Nemůžu říct, že bych rozuměl tomu, co jsem posléze dělal, takže vám neřeknu, které z následných kroků byly nezbytné.
Kdybych měl detailněji popisovat vše, co jsem v chatu řešil, nabobtnal by článek o několik stran a nejsem si jistý, zda by to k něčemu bylo, protože za pár dní může být vše zase jinak.
Do chatGPT jsem vložil odkaz na Blueprint a kompletní výpis logu. Na základě nich je ChatGPT schopný odhadnout, v čem nastal problém a jak by jej bylo možné napravit. Po chvíli jsme se dobrali k tomu, že ve virtuálním linuxovém stroji pravděpodobně nefunguje akcelerace GPU, je problém s propojením na GPU nebo něco podobného a v této fázi už by bylo nutné „bastlit“.
Narazíte-li na něco podobného, doptejte se obvykle používaných chatů s AI, jak to diagnostikovat a jestli to lze napravit.
U mě jednodušší řešení v podobě aktualizací a doplnění konfiguračního souboru nepomohlo, dal jsem tedy na radu ChatGPT, že v současnosti už je méně problematickým postupem instalace Dockeru, kterým nahradíme Podman, co ve skriptu původně měl fungovat. Znamená to zaregistrovat se na stránkách dockeru, stáhnout jej, nainstalovat a třeba s pomocí chatGPT v něm zprovoznit akceleraci na GPU.
To byla původně platforma pro tvorbu kontejnerů pro izolované spouštění aplikací. WSL 2 vylepšuje Docker Desktop na Windows jako jeho backend, poskytuje plné linuxové jádro a lepší výkon. NVIDIA Container Toolkit umožňuje kontejnerům Docker kontejnerům využívat akceleraci CUDA na GPU hostitele. Na Docker se odkazuje i oficiální návod pro instalaci NIM pro LLM přímo od Nvidie a je součástí jiných blueprintů. Vyžádalo si to registraci, stažení a instalaci.
ChatGPT mi dal rovnou kuchařku, podle které šel zprovoznit během pár minut i s podporou GPU NVIDIA, která je už v nastavení standardně zapnutá. Ověřili jsme, zda WSL2 funguje, jak má a pustili se do potřebných úprav skriptů v NIMu. Bylo potřeba vyhledat ve skriptech všechny výskyty výrazu podman za odpovídající alternativu pro docker, vytvořit nějaké pracovní složky a nastavit jim správná oprávnění a doladit další detaily. Skripty sice vracely chyby, ale bylo zřejmé, že se postupně dostávají dál a dál. Nejvíce úprav doznal hlavní skript nim.py, úpravy byly ještě v __init__.py a to je snad vše.
3d-guided-genai-rtx\ComfyUI_windows_portable\ComfyUI\custom_nodes\NIMnodes\nim.py 3d-guided-genai-rtx\ComfyUI_windows_portable\ComfyUI\custom_nodes\NIMnodes\__init__.py
Na snímcích níže jsou spíše pro představu změny ve skriptech, které chatGPT doporučil udělat. Tam už ale doporučím zařídit se podle aktuální situace, je možné, že zanedlouho bude jako hlavní aktuálně vyvíjená větev a skripty se budou dost významně lišit. A určitě záleží i na tom, jak moc budete modifikovat základní postup z NIMu.
Dál už vše už probíhalo cestou opakovaného spouštění skriptu z Blenderu, sledováním konzole pro debug v blenderu, nahlášením chatu, že mi to dělá to a tohle, kopírováním logů a hlášení, vkládáním screenshotů a otázek, v čem může být problém a co s tím.
Narazil jsem ještě na další chyby, u kterých byla nejspíš příčinou menší než doporučená kapacita systémové RAM – ale to jsem vyřešil tím, že jsem virtuálnímu stroji místo výchozích 16 GB přidělil asi 22 GB paměti a v konfiguraci prodloužil časy pro timeout Podle závěrečných doporučení z blueprintu by možná stačilo skript pouštět znovu – při opakovaném spouštění už skript běží rychleji, protože část dat už má uložených v cache. Šlo už ale o obvyklý způsob vychytávání chyb s někým, kdo tomu rozumí líp než vy, až se v NIMu postupně vše popropojovalo, dostahoval zbývající modely a soubory a konečně se rozjel a vygeneroval první obrázek.
⠀
















No, už jen zřídit multimodálního agenta nad celou platformou, který sám zvolí sadu odpovídající úkolu a vše zařídí na základě obecného uživatelského vstupu.
Na snímcích, co se vyznačují více detaily (okrasné prvky fasád, zábradlí), nebo jemnými texturami (jako mají například tkaniny) se zatím hodně podepisují ty upscalovací mezikroky, jako doslova probublávají. Pořád je to myslím nástroj spíše pro ty pixarovské (ghibliovské) obrázky. A teda pokud přežijete ten všudypřítomný nános kýče, ale možná to tak vnímám jenom já?
Je to povětšinou jak artworky z her. Otázka je, do jaké míry je to věc promptu a do jaké toho, na jakých datech se to trénuje.
Třeba ta podmořská scéna na druhém obrázku v poslední kapitole vypadá fotorealističtěji, ale promptem se mi nepovedlo dokopat ho k tomu, aby to nasvětlil jen jedním bodovým kuželem světla. Ještě víc jsem zíral na to, že mi na fontánu pod vodou pořád cpal tekoucí vodu.