Worum es geht
Der Kurs erzeugt viele Dateien: Porträts, Trainingsbilder, Modellstände, Stimmen, Clips. Damit du, dein Agent und jede spätere Sitzung immer wissen, wo was liegt, beginnt alles mit einer festen Struktur. Sie kommt fertig aus dem Kurs-Kit, einem kleinen Repository.
Was im Ordner liegt
avatar-kurs/
├── AGENTS.md Regeln für jeden Agenten (Claude Code liest sie als CLAUDE.md)
├── figur.json deine Figur: Stichwort, Klasse, Beschreibung, Stimme
├── entscheidungen.md jede Wahl, die du triffst, mit Datum und Grund
├── werkzeuge/ ComfyUI, ai-toolkit, TTS – je mit eigener Umgebung
├── modelle/ alle Modellgewichte an einem Ort
├── figur/
│ ├── gesicht/ A1: Kandidaten und referenz.png
│ ├── datensatz/ A2: Trainingsbilder mit Bildbeschreibungen
│ ├── lora/ A3: training.yaml, Zwischenstände, figur.safetensors
│ └── stimme/ A5: Entwürfe und referenz.wav
├── szenen/ A4: Szenenbilder
├── clips/<name>/ A6, A7: startbild, text, stimme, clip
└── skripte/ pruefen.py und was die Lektionen dazulegen
figur.json ist die eine Stelle für alles, was deine Figur ausmacht. Prompts, Konfigurationen und Skripte lesen von dort. Was du oben in der Kursleiste unter „Figur“ einträgst, landet in dieser Datei.
entscheidungen.md ist das Gedächtnis des Kurses. Jede Wahl bekommt eine Zeile: welches Gesicht, welcher Trainingsstand, welche Stimme. Der Agent schlägt vor, du entscheidest, danach trägt er die Zeile ein.
AGENTS.md sagt jedem Agenten, wo was hingehört und wie er mit der einen Grafikkarte umgeht. Claude Code und Hermes lesen die Datei, wenn sie im Kursordner starten. Deshalb gilt ab jetzt: den Agenten immer im Kursordner starten. Beim allerersten Mal ist der Ordner noch leer; der Prompt von A0 sagt dem Agenten, AGENTS.md nach dem Klonen zu lesen.
Der Prüfpunkt
Nach jeder Lektion zeigt skripte/pruefen.py, ob alles am richtigen Ort liegt, egal ob du von Hand gearbeitet hast
oder ein Agent. Nach A0 sieht das so aus:
A0 · Einrichten
✓ Ordner werkzeuge/
✓ Ordner modelle/
…
✓ figur.json: Stichwort „l3hr3r“ (4–12 Kleinbuchstaben oder Ziffern, ein Kunstwort)
✓ figur.json: Klasse „man“ (man, woman oder person)
✓ Python 3.14 (mindestens 3.10)
✓ git gefunden (Werkzeuge holen)
✓ ffmpeg gefunden (Ton und Video)
✓ hf gefunden (Modelle laden)
✓ Grafikkarte NVIDIA GeForce RTX 3090, 24 GB (empfohlen: 24 GB)
✓ Treiber 610.57.04 (mindestens 580 für CUDA 13)
✓ 1312 GB frei (empfohlen: 150 GB für Modelle und Werkzeuge)
→ fertig
✗ heißt: fehlt, die Lektion ist nicht fertig. ! heißt: geht, ist aber knapp, zum Beispiel bei wenig Speicherplatz. Ohne Lektionsnummer zeigt das Skript den Überblick über alle Schritte.
Entscheidungen
Welches Stichwort?
Ein Kunstwort, das es sonst nicht gibt
Das Stichwort ruft später deine Figur auf. Ein echtes Wort wie „teacher“ bringt mit, was das Modell schon darüber weiß. Ein Kunstwort aus Buchstaben und Ziffern, etwa „l3hr3r“, ist leer und wird ganz zu deiner Figur.
Welche Klasse?
Die Gruppe, zu der die Figur gehört: man, woman oder person
Beim Training schützt die Klasse alle anderen Menschen dieser Gruppe davor, das Gesicht deiner Figur zu bekommen (Lektion A3).
Fallstricke
Kit in einen Ordner mit Leerzeichen geklont
Manche Werkzeuge der späteren Lektionen kommen mit Leerzeichen im Pfad nicht zurecht.
LösungEinen Pfad ohne Leerzeichen und Umlaute nehmen, etwa ~/avatar-kurs.
„destination path '.' already exists and is not an empty directory“
git klont nur in einen leeren Ordner. Manchmal legt ein Werkzeug beim ersten Start schon eine Datei an.
LösungDen Ordner leeren oder einen neuen, leeren Kursordner anlegen und dort klonen.
Kursordner außerhalb des Volumes angelegt
Im Pod bleibt nur erhalten, was auf dem Volume liegt. Alles andere ist nach einem Neustart weg, auch installierte Werkzeuge.
LösungImmer unter /workspace arbeiten: cd /workspace, dann klonen.
Treiber zu alt
pruefen.py A0 meldet „Treiber … (mindestens 580 für CUDA 13)“ mit ✗. Die PyTorch-Pakete der späteren Lektionen laufen dann nicht.
LösungDen Pod neu anlegen und beim Mieten CUDA 13.0 als erlaubte Version wählen.
Das lokale Qwen belegt die Grafikkarte
Ein Sprachmodell mit 27 Milliarden Parametern braucht rund 18 GB Grafikspeicher. Bleibt es geladen, fehlt der Platz für Bildmodelle und Training.
LösungOLLAMA_KEEP_ALIVE=0 setzen, wie unter „Einmal vorher“ beschrieben, und mit nvidia-smi prüfen.