Koncepcja projektu: AI Kinetic Jazz Session (Wersja Wolumetryczna)
Polecenia
Wynik
Koncepcja projektu: AI Kinetic Jazz Session (Wersja Wolumetryczna)
1. Istota projektu
Stworzenie performansu w czasie rzeczywistym, w którym ruch ciała bezpośrednio generuje dźwięk przestrzenny i trójwymiarowe obrazy wizualne (hologramy).
Jest to synteza tańca, muzyki generatywnej i sztuki cyfrowej. Rezygnujemy z tradycyjnych interfejsów (klawiatur) i płaskich ekranów. Wizualizacja odbywa się bezpośrednio w powietrzu wokół performera, tworząc efekt obecności cyfrowej materii w przestrzeni fizycznej.
Zachowana zostaje zasada „Generatywnego Jam Session” i zamkniętej pętli sprzężenia zwrotnego (Feedback Loop): obiekty 3D zrodzone z ruchu są analizowane przez system i zmieniają parametry dźwięku, a dźwięk z kolei deformuje geometrię hologramów.
2. Uczestnicy i Role
1. Człowiek (Rzeźbiarz Kinetyczny i Reżyser Dźwięku)
-
Funkcja: Performer znajduje się wewnątrz projekcji wizualnej. Występuje jako rzeźbiarz cyfrowej materii i operator przestrzeni.
-
Interakcja:
-
Rzeźbienie dźwięku: Płynne gesty tworzą ciągłe tekstury, gwałtowne uderzenia rodzą perkusję.
-
Przestrzeń: Scena to jednolita objętość. Współrzędne ciała (X, Y, Z) sterują lokalizacją dźwięku (panoramowanie wokół widza) i położeniem hologramu.
-
-
Instrumenty: Ciało, choreografia i fizyczna obecność wewnątrz strumienia światła.
2. AI-Audio (Syntetyczna Orkiestra)
-
Funkcja: Interpretuje dane kinetyczne na dźwięk, tworząc złożony krajobraz Spatial Audio (Dźwięku Przestrzennego).
-
Zachowanie: Dźwięk jest fizycznie związany z obiektami wizualnymi. Jeśli hologram „przelatuje” przez performera z lewej na prawą stronę, dźwięk robi to samo (efekt Dopplera, panoramowanie binauralne).
3. AI-Visual (Architekt Wolumetryczny)
-
Funkcja: Generuje nie płaski obraz, a struktury 3D (chmury punktów, woksele, siatki/meshe) w czasie rzeczywistym.
-
Zadanie: Stworzyć iluzję, że obiekty cyfrowe fizycznie znajdują się na scenie obok człowieka, reagując na jego dotyk.
3. Architektura techniczna (Modułowa / Bare-metal)
Rezygnujemy z ciężkich systemów operacyjnych (Windows) na rzecz niezależnych węzłów obliczeniowych opartych na Linux / Embedded. Jest to krytyczne dla minimalizacji opóźnień (latency).
Węzeł 1: Hub Sensoryczny (Input Node)
-
Zadanie: Odczyt szkieletu (Body Tracking) i pozycjonowanie performera względem projekcji.
-
Środowisko: C++ / Python (MediaPipe / Azure Kinect SDK) na Linux (Headless).
-
Sensory: Kinect Azure lub Intel RealSense (uzyskują mapę głębi, aby hologramy poprawnie „opływały” człowieka, a nie były wyświetlane na nim).
Węzeł 2: Silnik Audio (DSP Node)
-
Zadanie: Generowanie dźwięku, synteza neuronowa (RAVE), sterowanie akustyką wielokanałową (Ambisonics).
-
Środowisko: SuperCollider lub Pure Data, uruchomione na jądrze Linux RT lub Elk Audio OS. Opóźnienie < 3 ms.
Węzeł 3: AI Wolumetryczne (Volumetric AI Node)
-
Zadanie: Generowanie treści 3D.
-
Technologie:
-
Depth Estimation AI (ZoeDepth): Przekształca generację 2D w mapę głębi w locie.
-
Point Cloud Rendering: Przekształcanie danych w chmurę cząsteczek, którą można obracać.
-
-
Sprzęt: NVIDIA Jetson AGX Orin (wykorzystuje TensorRT do akceleracji wnioskowania).
4. Scenariusz: Synteza w Przestrzeni
-
Inicjacja: Performer podnosi ręce, rozkładając je na boki.
-
Generacja: AI generuje teksturę „elektrycznej chmury”. Węzeł wizualizacji buduje model 3D.
-
Projekcja: Chmura jest rzutowana na siatkę holograficzną przed performerem. Dla widza wisi ona w powietrzu.
-
Interakcja: Performer wykonuje gwałtowny gest „ściśnięcia” pustki przed sobą.
-
Fizyka: Sensory odczytują gest. Cząsteczki chmury gwałtownie ściągają się w jeden punkt (w dłoń performera).
-
Dźwięk: Moduł Audio synchronicznie uruchamia efekt „Reverse Reverb”, który urywa się ostrym cyfrowym „kliknięciem” w momencie pełnego zaciśnięcia pięści.
-
Sprzężenie zwrotne: Błysk światła ze „ściśnięcia” jest analizowany przez system -> uruchamia się nowy cykl generowania dźwięku o bardziej agresywnej barwie.
5. Architektura Synestezji: Powiązanie Dźwięku i Obrazu
Aby chaos stał się sztuką, ustalamy sztywne reguły mapowania (powiązania parametrów).
A. Tonalność ↔ Kolor
-
Niskie częstotliwości (Bas, Ziemia): Głęboka czerwień, fiolet, brąz. Ciężkie, powolne cząsteczki na dole sceny.
-
Średnie częstotliwości (Ciało): Ciepły pomarańcz, zieleń. Cząsteczki na poziomie tułowia.
-
Wysokie częstotliwości (Powietrze): Neonowy błękit, biel, cyjan. Szybkie iskry nad głową.
B. Barwa ↔ Kształt
-
Sinusoida (Miękki): Obłe kształty, ciecz, dym, płynne gradienty.
-
Piła/Kwadrat (Ostry): Kryształy, wielokąty, ostre kąty, efekty glitch.
-
Szum (Noise): Piasek, ziarnistość, rozpad materii.
C. Przestrzeń ↔ Głębia
-
Dry (Suchy dźwięk): Obiekt wyraźny, jasny, znajduje się blisko performera.
-
Wet (Dużo pogłosu): Obiekt rozmyty, półprzezroczysty, wizualnie oddala się w głąb sceny.
6. Sprzęt: Wyświetlanie Obrazu
Jak uzyskać efekt hologramu na scenie:
Wariant A: Siatka holograficzna (Holographic Scrim)
-
Technologia: Przezroczysta posrebrzana tkanina (Holo-Gauze), rozpięta pod kątem lub pionowo. Niewidoczna w ciemności, ale łapie światło projektora.
-
Efekt: Performer stoi za siatką. Obraz unosi się przed nim.
-
Zalety: Skala (można zasłonić całą scenę), wysoka jasność.
Wariant B: Ekran mgłowy (Fog Screen)
-
Technologia: Ściana z suchej laminarnej mgły.
-
Efekt: Performer może przechodzić przez obraz, dosłownie wchodząc w cyfrowy portal.
-
Zalety: Pełna interaktywność i fizyczny kontakt z „ekranem”.
7. Plan Realizacji
-
Konfiguracja Bare-metal: Konfiguracja Linux RT na modułach obliczeniowych. Rezygnacja z GUI.
-
Sensoryka: Konfiguracja Kinect/RealSense do śledzenia szkieletu i oddzielania człowieka od tła (background subtraction).
-
Silnik Audio: Pisanie patch'y w SuperCollider do syntezy granularnej sterowanej współrzędnymi X/Y/Z.
-
Wolumetria: Konfiguracja generowania chmur punktów (Point Clouds) z tekstur sieci neuronowych na Jetsonie.
-
Kalibracja projekcji: Zgranie fizycznej pozycji performera i wirtualnych współrzędnych projektora (Projection Mapping).
8. Estetyka
To Cyfrowa Magia. Granice między ciałem fizycznym a światłem zacierają się. Zamiast realizmu stosujemy estetykę cząsteczek (piasek, iskry, świecący pył), ponieważ najlepiej sprawdza się ona w technologiach holograficznych i wybacza artefakty generacji.
9. Przydatne zasoby
Oprogramowanie (Linux/Code):
-
SuperCollider: supercollider.github.io — Silnik audio czasu rzeczywistego.
-
Pure Data: puredata.info — Wizualne programowanie DSP.
-
ZoeDepth: GitHub — AI dla map głębi.
-
TensorRT: Akceleracja AI na NVIDIA Jetson.
Sprzęt:
-
NVIDIA Jetson AGX Orin: Mózg dla wideo AI.
-
Elk Audio OS: System operacyjny dla audio z ultra-niskim opóźnieniem.
-
Intel RealSense / Azure Kinect: Kamery głębi.
-
Holo-Gauze: Profesjonalne siatki holograficzne.