#kod, wykonanie oraz skład, własny.
#StoryChainLab uważam za rodzaj rewolucji w zakresie generowania mikropowieści ponieważ model na podstawie odpowiednich promptów sterujących jest w stanie wygenerował spójną fabułę na podstawie dowolnego zdjęcia.
#npisanie tego narzędzia zajęło mi dużo czasu.

(wersja stabilna) (model zwraca tekst po angielsku) (testowane na lokalnych modelach multimodalnych: qwen3-vl-8b, nsfwvision-qwen3-vl-8b, modele no thinking)
StoryChain Lab to eksperymentalne środowisko do budowania narracji krok po kroku przy użyciu lokalnych multimodalnych modeli językowych. To laboratorium narracyjne.
Program nie działa jak generator książek. Zamiast tego prowadzi model przez serię etapów:
- analiza obrazu,
- interpretacja klimatu i świata,
- budowa postaci,
- tworzenie konfliktu,
- szkic fabularny,
- końcowa historia.
Każdy etap staje się kontekstem dla następnego. Dzięki temu użytkownik może obserwować, jak model rozwija narrację warstwa po warstwie zamiast generować wszystko jednorazowo.
Możliwości:
- analiza obrazu przy pomocy modeli multimodalnych,
- budowa kontekstu fabularnego etapami,
- zachowuje ciągłość między kolejnymi krokami,
- generuje szkice świata, postaci i konfliktów,
- tworzy eksperymentalne historie na bazie jednego obrazu,
- pozwala użytkownikowi ręcznie poprawiać każdy etap,
- działa całkowicie lokalnie przez LM Studio.
Najważniejszy element projektu to możliwość obserwowania procesu „myślenia narracyjnego” modelu w wielu krokach.
W praktyce oznacza to, że użytkownik może zobaczyć:
- jak model interpretuje obraz,
- jak rozwija motywy,
- jak buduje zależności między elementami świata,
- gdzie zachowuje spójność,
- oraz gdzie zaczyna się gubić.
To nie jest:
- profesjonalny silnik do pisania powieści,
- stabilny system pamięci długoterminowej,
- AI rozumiejące fabułę jak człowiek,
- generator perfekcyjnych historii,
- system gwarantujący logiczną spójność.
- modele lokalne nadal mają ograniczoną pamięć kontekstową i ograniczone rozumienie narracji.
Narzędzie zaprojektowałem tak, aby model generował opisy oraz fabułę po angielsku. Tego typu podejście okazało się być najlepszym rozwiązaniem ponieważ modele multimodalne z rodziny Qwen koszmarnie kaleczą język polski podczas pisania fabuły. One doskonale rozumieją polecenia, input użytkownika po polsku ale w przypadku pisania fabuły, nie sprawdzają się.
Zaimplementowałem możliwość użycia lokalnego translatora.
Teraz po wygenerowaniu finalnego tekstu w Stage6: Finałowa Fabuła (eng) możesz od razu przejść do translacji tekstu (tekst musi znajdować się w Stage 6). Przejdź do LMStudio, podmień model multimodalny na model translacyjny. Następnie odśwież GUI i Stage 7: Tłumaczenie.
Możesz importować pliki .txt do GUI celem ich translacji. Klikasz na [Wgraj tekst]. Wczytany tekst pojawia się w Stage 6.
Testowałem następujące modele multimodalne: qwen3-vl-8b-v3 Q6_K, nsfwvision-qwen3-vl-8b-v3 Q5_K_M, nsfwvision-qwen3-vl-8b-v3 Q8_0
(modele no thinking). Ogólnie modele o stopniu kwantyzacji Q4,Q5,Q6 wykazywały większą kreatywność. Modele typu Q8_0 wykazują pewną sztywność. Jeżeli zdecydujesz się użyć model Qwen-thinking, wówczas w GUI model nie będzie generował tekstu w czasie rzeczywistym a generowanie tekstu znacznie zostanie wydłużone.
Testowałem lokalne modele translacyjne: Bielik-11B-v3.0-Instruct Q5_K_M oraz Translategemma-4b/12b-it Q8_0.

1. Pobierz i zainstaluj LMStudio,
2. Za pomocą LMStudio pobierz model lokalny model multimodalny, najlepiej z rodziny Qwen
np. qwen3-vl-8b-v3 Q6_K albo nsfwvision-qwen3-vl-8b-v3 Q5_K_M (treści NSFW),
3. Załaduj model i uruchom Lokalny Server w LMStudio,
4. Musisz mieć poprawnie zainstalowany Python,
5. Rozpakuj .zip,
6. Kliknij install.bat celem zainstalowania potrzebnych requirements,
7. Kliknij start.bat,
8. W GUI wczytaj dowolny obraz,
9. Następnie przejdź przez wszystkie etapy od analizy treści obrazu po fabułę. Stage 1 do Stage 6.
10. Możesz modyfikować treść każdego Stage (poza Stage 6). Możesz wprowadzać poprawki w głównej treści albo w podsumowaniach. Po wprowadzeniu poprawek przejdź do kolejnego etapu.
11. Etap translacji. Wróć do LMStudio. Wyładuj model multimodalny i załaduj model translacyjny.
np. Bielik-11B-v3.0-Instruct Q5_K_M oraz Translategemma-4b/12b-it Q8_0.
12. W GUI przejdź do Stage 7: Tłumaczenie. Po jakimś czasie model zacznie generować tekst po polsku, w czasie rzeczywistym.
Translategemma 4b/12 dla LMStudio (patrz dołączone do paczki screen):
- w przypadku tego modelu może pojawić się problem,
- przeprowadź następujący test. Wczytaj model tgemma do LMStudio.
Wyślij tekst do tłumaczenia. Jeżeli zostanie wyświetlona informacja o błędnym prompt templates musisz wykonać kroki opisane poniżej,
- przejdź do [models]. zaznacz model translategemma-4b/12b-it.Q8_0, przejdź do [inference] (po prawej stronie),
- następnie odszukaj [prompt template], znajduje się po prawej stronie na samym dole w [inference],
- wybierz [prompt template] [maunal],
- zmień choose template na [ChatML]. Teraz tgemma będzie działać prawidłowo w LMStudio,
- model Bielik-11B-v3.0-Instruct Q5_K_M nie sprawia problemu.
WAŻNE:
- podczas generowania tekstu nie klikaj w poprzednie etapy,
- w momencie, w którym zaobserwujesz, że model lokalny z rodziny Qwen zapętlił się (najczęściej zdarza się to w Stage 6) po prostu zapisz tekst, wyjdź ze środowiska i wczytaj go celem translacji.
Aplikacja zawiera plik knowledge_base.json. Tu możesz dodawać własne słowa dla translatora. Jednak aby ta baza danych działała musisz ściśle przestrzegać formatu zapisu. Ostatnia linia nie może mieć przecinka.
{
"słowo angielskie": "twoje tłumaczenie",
"słowo angielskie:": "twoje tłumaczenie",
"słowo angielskie": "twoje tłumaczenie"
}
[ Pokaż/Ukryj ]
Podgląd zawartości dostępny jest tylko dla zalogowanych użytkowników.
|