Umfassende Lösung zur Erstellung von KI-Bildern während der Fahrt

🛒 Die umfassende Anwendungslösung von Midjourney für Designer und Entwickler deckt Kernszenarien wie Prompt Word Engineering, Rollenkonsistenzkontrolle, Stilmigration, Parameteroptimierung, Stapelgenerierung und kommerzielle Designanwendungen ab und bringt die führenden Vorteile von Midjourney im Bereich der KI-Bildgenerierung voll zur Geltung.

Midjourney KI-Bilderstellungslösung mit umfassender Funktionalität

Modul 1: Lösungsüberblick und Szenenpositionierung

1.1 Welches Problem löst die Lösung?

Diese Lösung hilft Designern, Kreativdirektoren und Content-Erstellern, den Full-Link-Workflow von der prompten Textentwicklung bis zur kommerziellen Bereitstellung systematisch zu meistern. Dabei sind keine Videogenerierungspipelines, 3D-Modellierungsprozesse oder professionelle Druckausgaben erforderlich, sondern der Schwerpunkt liegt auf der qualitativ hochwertigen Erstellung und Bereitstellung von Standbildern in großem Maßstab.

Midjourney ist derzeit eine der künstlerisch ausdrucksstärksten KI-Bildgenerierungsplattformen der Welt. Seit seiner öffentlichen Beta im Juli 2022 hat es das V7-Modell übernommen und ist weiterhin führend in der Kompositionsästhetik, der Licht- und Schattentextur sowie der Stilvielfalt. Öffentlichen Daten zufolge hat die Discord-Community von Midjourney im Jahr 2026 mehr als 30 Millionen Mitglieder und Millionen monatlich aktiver Schöpfer und deckt mehrere kommerzielle Anwendungsbereiche ab, darunter Werbekreativität, Spielkonzeptdesign, Markenvision, zukunftsweisende Filme und Fernsehen, Produktdesign, Mode und Architektur.

Der Wert dieser Lösung liegt darin, Midjourney von der „Generierung schöner Bilder“ zu einem „kontrollierbaren, reproduzierbaren und skalierbaren“ Erstellungstool zu machen. Zu den Hauptvorteilen gehören:

  • Effizienz der Konzeptexploration um mehr als das Zehnfache verbessert: Der Zyklus vom Andocken der Nachfrage bis zur Ausgabe des ersten Entwurfs wird von Tagen auf Dutzende Minuten komprimiert
  • Kontrollierbare Stilkonsistenz: Erzielen Sie eine konsistente Ausgabe von Serienwerken durch Parameter wie Stilreferenz (--sref), Zeichenreferenz (--cref)
  • Standardisierung der Stapelausgabe: Arbeiten Sie mit Parametervorlagen und Postproduktionstools zusammen, um den gleichen Stil und mehrere Versionen der Materialmatrix zu erreichen
  • Überarbeitung der Kommunikation reduzieren: Auch Nicht-Designer können Midjourney nutzen, um schnell visuelle Referenzen zu erstellen und Informationsverluste bei der Nachfragekommunikation zu reduzieren.

1.2 Anwendbare Grenze

Abmessungen Anwendbar Nicht anwendbar
Inhaltstyp Konzeptdesign, Markenvisualisierungen, Werbematerialien, Illustrationen, Produktdarstellungen Präzise Vektorgrafiken, professioneller Satz, Farbmanagement in Druckqualität
Teamform Kreative Produktion von Werbe-/Branding-/Spiel-/Film- und Fernsehteams Rein codegesteuerte automatisierte Massenproduktionslinien
Benutzer Designer + kreative Planer + visuelle Kommunikation für Nicht-Design-Positionen Teams, die einen gewissen Widerstand gegen KI-Tools haben oder denen es an Fundament mangelt
Lieferstandards Konzeptvorschläge, Social-Media-Materialien, visuelle Erkundung der Marke Es müssen bestimmte Industriestandards eingehalten werden (z. B. präzise Pantone-Farbanpassung)

1.3 Voraussetzungen

  • Besitzen Sie ein Midjourney-Abonnementkonto (Basisversion beginnt bei 10 $/Monat; Pro-Version beginnt bei 60 $/Monat)
  • Stabiler Zugriff auf die Discord-Plattform oder die Midjourney Alpha-Weboberfläche
  • Sie verfügen über ein grundlegendes Urteilsvermögen über die Bildästhetik und verstehen Designsprachen wie Komposition, Licht und Schatten sowie Farbe
  • Es gibt ein Nachbearbeitungstool (empfohlen Canva AI oder Photoshop) zur Ausgabeverfeinerung

1.4 Toolchain-Übersicht

Werkzeuge Kernzweck Kostenreferenz Rolle in der Lösung
Midjourney Bilderzeugungskern 10–60 $/Monat Hauptmaschine: Konzepterkundung, Stilexperimente, Batch-Ausgabe
ChatGPT Prompte Word-Engineering-Unterstützung Kostenlos / 20 $/Monat Assistent: Anforderungen demontieren, schnelle Word-Vorlagen erstellen und polnische Übersetzung
Canva AI Nachbearbeitung und Satz Kostenlos / 13 $/Monat Verfeinerung: Größenanpassung, Textüberlagerung, Farbkorrektur
Leonardo AI Ergänzungserzeugung und Modellerweiterung Kostenlos / Pay-as-you-go Ergänzung: generierte Materialien, teilweise Bearbeitung von AI Canvas
Stable Diffusion Lokales Debuggen von Open-Source-Modellen Kostenlos (Grafikkarte erforderlich) Alternative: lokale privatisierte Bereitstellung und ComfyUI-Workflow
D-ID Konvertieren Sie ein statisches Bild in ein digitales menschliches Video Kostenlos / Pay-as-you-go Erweiterung: Midjourney-Charakterbild in dynamisches gesprochenes Video konvertieren

Modul 2: Prompt Word-Projekt – strukturierte Übersetzung vom Text ins Visuelle

Aufforderungsworte sind ein zentraler Input für den Midjourney-Workflow. Eine hervorragende Eingabeaufforderung ist nicht „Schreiben“, sondern strukturierte Übersetzung: Zerlegen der Designanforderungen in Dimensionen wie Thema, Umgebung, Stil, Komposition, Beleuchtung, Textur usw. und anschließendes Umwandeln in semantische Codes, die Midjourney verstehen kann.

2.1 Fünf-Elemente-Rahmen für Aufforderungswörter

Jedes wirksame Aufforderungswort sollte die folgenden fünf Informationsdimensionen enthalten:

Dimension Rolle Beispiel
Betreff Identifizieren Sie das Kernobjekt im Bild „eine Kriegerin“, „ein Glas Matcha Latte“
Umwelt Szenen und Hintergrundeinstellungen „in einer neonbeleuchteten Cyberpunk-Stadt“, „auf einer Marmorarbeitsplatte“
Stil Kunststil oder Medium-Referenz „Digitale Malerei von Greg Rutkowski“, „minimalistische Vektorgrafiken“
Beleuchtung/Farbe Atmosphäre und Farbton „Filmische Beleuchtung, warme goldene Stunde“, „kalte Blautöne“
Parameter Bildschirmverhältnis, Stilisierungsintensität, Chaos usw. --ar 16:9 --s 250 --chaos 30 --v 7

Tipp für die professionelle Praxis: Verwenden Sie zunächst ChatGPT, um die chinesischen Anforderungen in diese fünf Dimensionen zu übersetzen und in englische Fragmente zu zerlegen, und fügen Sie sie dann in vollständige Eingabeaufforderungswörter zusammen. Dies verbessert nicht nur die Effizienz, sondern reduziert auch semantische Verzerrungen durch Nicht-Muttersprachler.

2.2 Prompt Word-Vorlage und Variantenverwaltung

Der Aufbau einer persönlichen Wortvorlagenbibliothek für Eingabeaufforderungen ist der Ausgangspunkt für eine groß angelegte Ausgabe. Es wird empfohlen, nach folgenden Kategorien zu verwalten:

„ 📁 Aufforderungen/ ├── Zeichen/ # Zeichenklasse │ ├── fantasy-warrior.md │ └── sci-fi-soldier.md ├── Produkte/ # Produktwiedergabe │ ├── hautpflege-flasche.md │ └── Sneaker-Showcase.md ├── Umgebungen/ # Umweltkonzept │ ├── futuristische-stadt.md │ └── Forest-Temple.md └── Stile/ # Stilreferenz ├── Aquarell.md └── cyberpunk-neon.md „

In jeder Vorlagendatei aufgezeichnet: Grundlegende Eingabeaufforderungswörter, Schlüsselparameter, Stil-Referenzbild-Link, Variantenregeln (zum Beispiel können 3-5 Varianten nach dem Ersetzen des Betreffs/der Umgebung abgeleitet werden).

2.3 SOP für schnelle Wortiteration

„ Anforderungseingabe → Fünf-Faktoren-Demontage → Erstgenerierung → Bewertung (unbefriedigende Dimensionen) → Festlegen von 1-2 Dimensionen, die nicht zufriedenstellend sind → gezielte Modifikationen → Regeneration → Zyklus, bis die Akzeptanz erreicht ist. „

Gate-Kontrolle: In jeder Iterationsrunde werden nur 1–2 Variablen geändert, um zu vermeiden, dass gleichzeitige Änderungen in mehreren Variablen zu einer Inattribution führen. Es wird empfohlen, den Parameter „--seed“ zu verwenden, um den anfänglichen Zufallsstartwert festzulegen und Iterationen vergleichbar zu machen.

2.4 Häufige Wortfallen und Korrekturen bei Eingabeaufforderungen

Symptom Grundursache Korrekturmethode
Der generierte Inhalt weicht von den Anforderungen ab Die Hauptbeschreibung ist ungenau Fügen Sie konkrete Substantive hinzu, um abstrakte Konzepte zu ersetzen (z. B. „Beagle“ anstelle von „Hund“)
Unkontrollierter Stil Fehlende Stilstärken oder Referenzbild Fügen Sie „--sref [URL]“ hinzu oder geben Sie den Künstlerstil an
Zu viele Bildschirmelemente Aufforderungswörter sind zu lang und semantisch verstreut Auf 20–40 Wörter komprimiert, um sich auf das Kernthema zu konzentrieren
Komposition wiederholen Keine Verwendung von --s oder --chaos zur Steuerung der Vielfalt Erhöhen Sie den Wert „--s“ (400–1000) oder den Wert „--chaos“ (30–80)

Modul 3: Stilkontrolle und Referenzbildsystem

Midjourney V6/V7 bietet einen leistungsstarken Stilreferenzmechanismus, der das Kernwerkzeug für die Erzielung von Markenkonsistenz und Stilwiederverwendung darstellt.

3.1 Stilreferenz (--sref)

Mit dem Parameter „--sref“ können Sie ein oder mehrere Referenzbilder als Stilquelle hochladen. Midjourney wird die Farb-, Textur- und Kompositionslogik extrahieren und auf die aktuelle Generation anwenden.

Anwendungsbeispiel: „ /imagine prompt: eine Luxusuhr auf Marmoroberfläche --sref https://example.com/style-ref.jpg --sw 100 „

Der Parameter „--sw“ (Style Weight) steuert die Stärke des Referenzstils, Bereich 0–1000, Standard 100.

Praktische Vorschläge:

  • Einzelbildreferenz: geeignet für eine einzelne Quelle mit klarem Stil (z. B. Farbpalette in einem Markenführer)
  • Mehrere Bildreferenzen (2–5 Bilder): Trennen Sie URLs durch Leerzeichen, Midjourney integriert automatisch Stilfunktionen
  • Stilgewichtungsstrategie: Wenn Sie möchten, dass die generierten Ergebnisse näher am Referenzbildstil liegen, legen Sie „--sw 200–400“ fest; Wenn Sie mehr Freiheit wünschen, stellen Sie „--sw 50–100“ ein

3.2 Rollenreferenz (--cref)

Der Parameter „--cref“ erreicht die Konsistenz zwischen generierten Charakteren, was die Kernfunktion für die Erstellung von IP-Charakteren und Serienwerbecharakteren darstellt.

Anwendungsbeispiel: „ /imagine prompt: Die Figur trägt einen Business-Anzug und steht in einem modernen Büro --cref https://example.com/character.jpg --cw 50 „

„--cw“ (Consistency Weight) steuert die Zeichenkonsistenzstärke im Bereich von 0–100:

  • „--cw 100“: Gesicht, Körperform und Kleidung des Charakters strikt beibehalten
  • „--cw 50“: Gesichtszüge + etwas Kleidung beibehalten, an neue Szenen anpassen
  • „--cw 0“: Nur Gesichtszüge bleiben erhalten, Kleidung und Umgebung werden vollständig durch prompte Worte gesteuert

Vorschläge zur Verwaltung der Charakterbibliothek: Erstellen Sie für jedes Projekt einen Zeichenreferenzzeichnungsordner und notieren Sie den besten Wert von „--cw“ für jede „--cref“-Zeichnung. Besonderer Hinweis: Referenzbilder derselben Figur in unterschiedlichen Szenen, Lichtverhältnissen und Blickwinkeln sollten aus drei bis fünf verschiedenen Blickwinkeln gesammelt werden, damit Midjourney den „dreidimensionalen Sinn“ der Figur verstehen und das Problem der wiederholten Generierung desselben Blickwinkels verringern kann.

3.3 Bildaufforderungen

Fügen Sie die Bild-URL direkt in die Eingabeaufforderung ein (kein Parameterpräfix erforderlich), und Midjourney verwendet das Bild als umfassende Referenz für Komposition, Farbe und Motiv und arbeitet mit der Texteingabe zusammen.

Best Practice:

  • Die Gewichtung des Bild-Prompts wird durch die Position des Bildes im Prompt-Wort bestimmt: Je näher es ist, desto größer ist das Gewicht.
  • Kombinationsstrategie: Das erste Bild dient als Kompositionsreferenz, das zweite Bild als Stilreferenz und Textansagen beschreiben das spezifische Thema.
  • Bildaufforderung + Parameter „--iw“ (Bildgewichtung) steuert den Bildeinfluss, Bereich 0,5–2,0, Standard 1,0

3.4 Stilmigrations-Workflow (Konzepterkundungsphase)

„ Projektpositionierung → Sammeln Sie 3-5 Stilreferenzbilder → Testen Sie den --sref-Fusionseffekt → Passen Sie --sw an die gewünschte Stilstärke an → Finalisierung des Ausgabestils → Verwenden Sie diesen endgültigen Stil als feste Stilquelle, um verschiedene Themen zu wechseln und eine Reihe von Werken zu erstellen „

Gate Control: Der endgültige Stil muss von mindestens drei verschiedenen Probanden getestet werden, um Stilstabilität und keine zufällige Übereinstimmung zu gewährleisten. Nach bestandenem Test kann es als Projektstilquelle gesperrt werden.


Modul 4: Parameteroptimierung und erweiterte Steuerung

Das Parametersystem von Midjourney wirkt sich direkt auf die Ausgabequalität und die Steuerungsgenauigkeit aus. Im Folgenden sind die am häufigsten verwendeten und praktischsten Parameter aufgeführt.

4.1 Kernparameter-Spickzettel

Parameter Funktion Empfohlene Anfangswerte Stimmrichtung
--ar Seitenverhältnis Hängt vom Lieferszenario ab 1:1 Social / 16:9 Video / 9:16 Mobile / 3:2 Print
--s (Stilisieren) Stilisierungsintensität (0–1000) 250 Niedrig (50) realistisch / hoch (600) künstlerisch
--chaos Ergebnisvielfalt (0–100) 0–10 30–80 für die Konzepterkundung, 0–10 für die Finalisierung
--v Modellversion 7 Behalten Sie die neueste stabile Version
--seed Zufälliger Samen Für automatisches leer lassen Startwert korrigiert, um Iterationen vergleichbar zu machen
--iw Bildreferenzgewicht (0,5–2,0) 1,0 Erhöhen, wenn das Referenzbild wichtig ist
--sw Stil-Referenzgewicht (0–1000) 100 Anpassung der Stilintensität
--cw Rollenkonsistenz (0–100) 50 Nur wirksam im --cref-Szenario
--nein Elemente ausschließen Auf Anfrage „--kein Text, Wasserzeichen, Signatur“
--tile Nahtlose Fliesen Erstellen Sie wiederholbare Texturen

4.2 Parameterkombinationsstrategie

Realistischer Fotografiestil: „ --ar 3:2 --s 50 --v 7 --style raw „ „--style raw“ reduziert die standardmäßige Stilisierung und Verschönerung von Midjourney und kommt dem Effekt der Direktfotografie näher.

Konzeptkunststil: „ --ar 16:9 --s 600 --chaos 40 --v 7 „ Hohe Stilisierung + mittleres Chaos, gut für die Erkundung unkonventioneller konzeptioneller Kompositionen.

Einfacher Stil von E-Commerce-Produkten: „ --ar 1:1 --s 100 --v 7 --style raw „ Geringe Stilisierung + „--style raw“ + neutrale Lichtbeschreibung, geeignet für den weißen Produkthintergrund oder den Studioaufnahmestil.

4.3 Seed-Kontrolle und Versions-Backtracking

„--seed“ ist ein wichtiges Steuerungstool in iterativen Arbeitsabläufen:

  1. Erste Generation: Notieren Sie die Seed-Nummern von 4 Ergebnissen
  2. Sperren Sie den Ziel-Seed: Verwenden Sie „--seed [Nummer]“, um 1-2 Elemente im Eingabeaufforderungswort zu ändern
  3. Feinabstimmung der Iteration: Passen Sie bei einem festen Startwert schrittweise „--s“ oder „--sw“ an und beobachten Sie die Änderungen.
  4. Versionsarchivierung: Zeichnen Sie die Seeds, Parameter und Aufforderungswörter jeder Iterationsrunde gemeinsam auf

Zugriffskontrolle: Nach dem Setzen der Seed-Sperre ist nur die Änderung einzelner Variablen zulässig. Wenn festgestellt wird, dass der Effekt nachgelassen hat, kehren Sie sofort zur Startwert- und Parameterkombination des vorherigen Schritts zurück, ohne weitere Änderungen vorzunehmen.

4.4 Auswahl des Versionsmodells

Modellversion Funktionen Anwendbare Szenarien
V7 (Standard) Die neueste Version, mit der besten Komposition und den besten Details Die erste Wahl für alle neuen Projekte
V6 Ausgereift und stabil, mit guter ökologischer Werkzeugunterstützung Kompatibel mit alten Projekten und der Verwendung von Plug-Ins von Drittanbietern
Niji 7 Zweidimensionale/Animationsoptimierung Japanische Illustrationen, Charakterdesign, Comic-Stil
Stilreferenz Die Stilkonsistenz unter V7 ist am stärksten Markenvision, Werkreihe

Modul 5: Praxis für kommerzielle Designszenarien

5.1 Visuelle Produktion von Markenwerbung

Szenariobeschreibung: Eine Teegetränkemarke benötigt eine Reihe von Key Visuals für die Einführung neuer Produkte im Frühjahr, darunter Poster, Social Media und E-Commerce-Banner.

Ausführungsprozess:

  1. Finalisierung des Markenstils (1 Tag)

    • Sammeln Sie Farb- und Logo-Referenzbilder aus dem Brand VI-Handbuch
    • Verwenden Sie „--sref“, um 3 Sätze von Stilreferenzen zu testen und 1 Satz zu sperren
    • Ausgabe des endgültigen Markenstils
  2. Erstellung von Produktbildern (2 Tage)

    • Verwenden Sie „--cref“, um auf vorhandene Produktbilder zu verweisen und neue Produktbilder aus verschiedenen Blickwinkeln und Szenarien zu generieren.
    • Kernworte der Aufforderung: „ein Glas rosa Grapefruit-Grüntee mit Eiswürfeln, natürliches Sonnenlicht, Draufsicht –ar 1:1 –s 100 –v 7 –style raw“.
    • Generieren Sie 4 Varianten pro Winkel, wählen Sie die beste aus und fixieren Sie die Feinabstimmung mit „--seed“.
  3. Scene Graph Extension (2 Tage)

    • Konstruieren Sie verschiedene Nutzungsszenarien: Picknick im Freien, Café, Heimbüro
    • Behalten Sie „--sref“ bei, um den Markenstil zu finalisieren und Text- und Umgebungsbeschreibungen zu ersetzen
  4. Mehrfache Größenanpassung (1 Tag)

    • Midjourney generiert das Hauptbild („--ar 16:9“, „--ar 1:1“, „--ar 9:16“) – Importieren Sie Canva AI, um Text- und Markenelemente hinzuzufügen

Lieferung: 3 Szenen × 3 Größen = 9 endgültige Materialien, geeignet für Douyin, Xiaohongshu, Moments und E-Commerce-Hauptbilder.

Annahmekriterien: Jedes Material muss die Farbspezifikationsüberprüfung des Markenteams bestehen (Pantone-Wertabweichung liegt im akzeptablen Bereich) und das Copywriting-Layout muss den Designspezifikationen der Marke VI entsprechen.

5.2 Konzeptdesign für Spielcharaktere

Szenariobeschreibung: Ein Open-World-RPG-Spiel erfordert konzeptionelle Designzeichnungen von 5 Hauptcharakteren.

Ausführungsprozess:

  1. Einstellung von Zeichentexten (abgestimmt auf die Planung)

    • Erstellen Sie für jeden Charakter ein Einstellungsdokument mit 100 bis 200 Wörtern: Aussehen, Persönlichkeit, Kleidung, Waffen und Hintergrundgeschichte
    • Verwenden Sie ChatGPT, um Einstellungen in fünf Elemente von Aufforderungswörtern zu unterteilen
  2. Erste Erkundung (3 Tage)

    • Generieren Sie 8–16 Versionen jedes Charakters, „--chaos 60“, für umfassende Erkundungen
    • Die Teambewertung wählt 2–3 Richtungen aus
  3. Charakter-Finalisierung (2 Tage)

    • Wählen Sie die Richtung aus, um die Variabilität des Aufforderungsworts „--chaos 10“ zu verringern
    • Verwenden Sie „--cref“, um Gesichts- und Körpermerkmale von Charakteren zu korrigieren
    • Mehrwinkelausgabe: vorne, 3/4 seitlich, hinten, Aktionshaltung
  4. Archiv der Charakterbibliothek

    • Jeder Charakter wird gespeichert: vorderes Standardbild + 3/4 Seite + ganzer Körper + Ausdruckssatz (Emotionen, Wut, Trauer und Freude)
    • Notieren Sie den Referenzkartenpfad „--cref“ und den optimalen Wert „--cw“ für jedes Zeichen

Wichtige Tipps: Das häufigste Problem bei der Gestaltung von Spielcharakterkonzepten ist „Inkonsistenz der Charaktere aus verschiedenen Blickwinkeln“. Die Lösung besteht darin, für jeden Charakter drei bis fünf Referenzgalerien aus verschiedenen Blickwinkeln zu erstellen und diese abwechselnd in „--cref“ zu verwenden, um dem Modell dabei zu helfen, ein „dreidimensionales Verständnis“ des Charakters zu entwickeln. Wenn es immer noch inkonsistent ist, können Sie die Midjourney-Ausgabe zur teilweisen Korrektur in Leonardo AI importieren.

5.3 E-Commerce-Produktvideo-Cover und Materialmatrix

Szenariobeschreibung: Das grenzüberschreitende E-Commerce-Team muss jeden Monat mehr als 200 Produktdarstellungsbilder produzieren, die Amazon, Shopify, TikTok Shop und andere Kanäle abdecken.

Ausführungsprozess:

  1. Alternative zum Produktfotoshooting (fortlaufend)

    • Verwenden Sie Midjourney, um hochauflösende Produktszenenbilder zu erstellen und so einen Teil der Kosten für Außenaufnahmen zu ersetzen
    • Sofortiger Wortfokus: Materialdetails (Lederstruktur, Metallreflexion, Stofffalten)
  2. Mehrfarben-/Multispezifikationsvarianten (Batch-Modus)

    • Die Aufforderungswörter für Komposition und Szene wurden korrigiert und Farb- oder Spezifikationswörter im Hauptteil ersetzt
    • Verwenden Sie „--seed“, um den Startwert zu korrigieren und nur den Farbdeskriptor zu ändern
    • Verwenden Sie ein Skript, um Archive nach der Stapelgenerierung automatisch zu benennen
  3. A+-Inhaltsmaterial (auf Anfrage)

    • Erstellen Sie Lifestyle-Szenendiagramme (Szenarien der verwendeten Produkte)
    • Detaillierte Nahaufnahmen (vergrößerte Teile der Produktmaterialien und Funktionsdetails)

Kostenvergleich: Herkömmliche Outdoor-Aufnahmen kosten 500–2000 Yuan pro Produkt, während die Midjourney-Lösung etwa 10–30 Yuan pro Produkt kostet (einschließlich Abschreibung der Abonnementgebühr + spätere Anpassungszeit).

5.4 Konzeption vor Film und Fernsehen

Szenenbeschreibung: In der Anfangsphase von Film- und Fernsehprojekten müssen schnell Szenenkonzeptzeichnungen für die Pitch- und Budgetbewertung erstellt werden.

Ausführungsprozess:

  1. Extraktion von Drehbuchszenen (1 Tag)

    • Teilen Sie das Drehbuch in wichtige Szenenknoten auf
    • Extrahieren Sie jede Szene: Zeit, Ort, Beleuchtung, Stimmung, Referenzfilmstil
  2. Style Moodboard (2 Tage)

    • Sammeln Sie Screenshots und Grafiken, die auf Filme verweisen
    • Verwenden Sie „--sref“, um eine einzigartige visuelle Note für das Projekt zu erzielen
  3. Keyframe-Generierung (3–5 Tage)

    • Generieren Sie 4–8 Konzeptversionen jedes Schlüsselszenarios
    • Anmerkung: Objektivwinkel, Brennweitenempfehlung, Beleuchtungsrichtung
    • Diese Ausgänge können direkt als Referenz für die Kommunikation zwischen DIT und DP verwendet werden
  4. Charakter-Styling-Test (2 Tage)

    • Verwenden Sie „--cref“, um verschiedene Stiloptionen für Schauspieler/Charaktere zu testen
    • Ändern Sie Kleidung, Frisur, Make-up und sehen Sie sich den Bildschirmeffekt in der Vorschau an

Annahmekriterien: Der Konzeptzeichnung muss eine Beschreibung der technischen Parameter (Brennweite des Objektivs, ISO-Empfindlichkeit, Lichtfarbtemperatur usw.) beigefügt sein, damit das Aufnahmeteam direkt als Referenz für Beleuchtungs- und Kameraeinstellungen dienen kann.


Modul 6: Batch-Generierung, Postproduktionszusammenarbeit und Asset-Management

6.1 Strategie zur Batch-Generierung

Wenn eine große Ausgabemenge (mehr als 50 Blatt/Tag) erforderlich ist, ist die manuelle Eingabe der Eingabeaufforderungswörter nacheinander zu ineffizient. Das Folgende ist eine praktische Batch-Strategie:

Strategie 1: Prompt-Wortvorlage + Variablenersetzung „ Basis: „ein [PRODUKT] auf [OBERFLÄCHE], [BELEUCHTUNG], Produktfotografie –ar 3:2 –s 100 –v 7“ Variablen: PRODUKT: „minimalistischer weißer Sneaker“ | „Tragetasche aus Leder“ | „Hülle für kabellose Ohrhörer“ OBERFLÄCHE: „Betonboden“ | „Holztisch“ | „Marmor-Arbeitsplatte“ BELEUCHTUNG: „sanftes Studiolicht, sauberer Hintergrund“ | „warmes Seitenlicht zur goldenen Stunde“ „ Jede Kombination = 1 Build, manuell in Stapeln oder über die Discord Bot-Automatisierung eingegeben.

Strategie 2: Upscale zuerst + Remix-Erweiterung

  • In der ersten Runde umfassend generiert, um die beste Komposition auszuwählen
  • Verwenden Sie die Remix-Funktion nach Upscale, um 1-2 Schlüsselwörter in den Aufforderungswörtern zu ändern
  • Behalten Sie die gleiche Komposition bei, ersetzen Sie nur Stil, Farbe oder sekundäre Elemente
  • Ein einzelner Upscale-Graph kann 6–10 Varianten ableiten

6.2 Zusammenarbeitsprozess nach der Verfeinerung

Die Ausgabe von Midjourney erfordert in den meisten Geschäftsszenarien eine Nachanpassung. Das Folgende ist eine Standard-Pipeline für die Zusammenarbeit:

„ Rohausgabe während der Reise → Upscale (Upscale 2x / 4x, Pro-Abonnement erforderlich) → Import in Canva AI/Photoshop → Ausführung: Größenzuschnitt, Farbkorrektur, Copywriting-Overlay, lokale Fehlerreparatur → Endgültige Ergebnisse ausgeben „

Häufig verwendete Nachoperationen:

  • Hintergrundentfernung: Verwenden Sie das automatische Hintergrundentfernungstool von Canva AI, um das Motiv zu extrahieren
  • Farbanpassung: Passen Sie Farbtemperatur, Sättigung und Kontrast an Ihre Markenpalette an
  • Textüberlagerung: Midjourney ist nicht gut darin, Text zu generieren, alle Kopien müssen in Postproduktionstools hinzugefügt werden
  • Teilweise Reparatur: Midjourney weist manchmal Verzerrungen in Details auf (Finger, Logo, Text). Verwenden Sie Nachbearbeitungswerkzeuge, um diese zu reparieren

6.3 Spezifikationen für die Benennung und Verwaltung von Assets

Um Verwirrung während der Bereitstellungsphase zu vermeiden, wird empfohlen, die folgenden Regeln für die Dateibenennung festzulegen:

„ {Projektcode}{Typ}{Nummer}{Version}{Auflösung}.png Beispiel: spring2025_poster_01_v3_4k.png „

Klassifizierungsarchivstruktur: „ 📁 Lieferungen/ ├── Frühlingskampagne-2025/ │ ├── Poster/ │ │ ├── spring2025_poster_01_v3_4k.png │ │ └── spring2025_poster_02_v1_4k.png │ ├── sozial/ │ │ ├── spring2025_ig_01_v2_1080.png │ │ └── spring2025_tiktok_01_v2_1080.png │ └── Aufforderungen/ │ └── spring2025_prompts_template.md „

Jedes Projektverzeichnis verfügt über ein Unterverzeichnis „prompts/“, um vollständige Eingabeaufforderungswörter und Parameterdatensätze für eine spätere Reproduktion oder Änderung zu speichern.

6.4 Erweiterte Integration mit D-ID

Importieren Sie das von Midjourney generierte statische Zeichendiagramm in D-ID, um schnell ein digitales gesprochenes Video zu erstellen. Der Prozess ist wie folgt:

  1. Midjourney erstellt ein Frontalporträt der Figur („--ar 9:16“, eine aufrechte Halbkörperkomposition wird empfohlen)
  2. Entfernen Sie den Hintergrund in Canva AI
  3. Importieren Sie D-ID und fügen Sie Copywriting-Skripte und Sounds hinzu
  4. Ausgabe als kurzer Videoinhalt (TikTok / Reels / Kundendienstanweisungen)

Diese Kombination eignet sich besonders für: virtuelle Anker, Produktbeschreibungsvideos und Marken-IP-Charakterverknüpfung.


Modul 7: Implementierungszyklus, Teamkonfiguration und Risikokontrolle

7.1 Phasenweiser Implementierungsplan

Phase Zeit Ziel Schlüsselausgabe
Phase 1: Grundlegende Meisterschaft Wochen 1–2 Vertraut mit der Midjourney-Benutzeroberfläche, grundlegenden Eingabeaufforderungswörtern und Parametern Erste Version der persönlichen Word-Vorlagenbibliothek für Eingabeaufforderungen
Phase 2: Stilkontrolle Wochen 3–4 --sref, --cref und Stilmigration beherrschen 1 letzter Satz Markenstil + Charakter-Referenzbibliothek
Phase 3: Parameterbeherrschung Wochen 5–6 Parameterkombinationen und Saatgutkontrolle beherrschen Parameter-Vorlagenmatrix (deckt 8 gängige Stile ab)
Phase 4: Geschäftspraxis Wochen 7–10 Schließen Sie den gesamten Prozess des ersten kommerziellen Projekts ab Vollständige Geschäftsergebnisse + Überprüfungsdokumente
Phase 5: Skalierung Wochen 11–12 Einrichtung eines SOP- und Asset-Management-Systems für die Batch-Generierung Batch-Generierungspipeline + Namenskonvention + Archivierungssystem

7.2 Teamrollenkonfiguration

Rolle Anzahl der Personen Verantwortlichkeiten
KI-Designer (Hauptbetreiber) 1–2 Personen Schnelles Schreiben von Wörtern, Parameteroptimierung, Stilkontrolle
Kreativdirektor 1 Person Richtungsentscheidung, Stilakzeptanz, Lieferüberprüfung
Nachbearbeitung 1 Person Verfeinerung, Satz, Farbkorrektur
Planung/Kommunikation 1 Person Bedarfsabbau, Projektmanagement, Kundenandockung

Ein Ein-Personen-Team kann die oben genannten Aufgaben durch eine sinnvolle Terminplanung abdecken, wobei der Schwerpunkt auf dem zweizeiligen Parallelrhythmus „Bedarfsabbau + Hauptbetrieb“ liegt.

7.3 Risikokontrolle und Zugangskontrolle

Arten von Risiken Spezifische Risiken Vorbeugende Maßnahmen Reaktionspläne
Qualitätsdrift Die Wirkung desselben Aufforderungsworts ist in verschiedenen Versionen des Modells sehr unterschiedlich Sperren Sie die Versionsnummer („--v 7“), um die Modellversion zu verdeutlichen Notieren Sie die Änderungen an Seeds und Parametern nach dem Versionswechsel
Schnelle Worte sind außer Kontrolle Lange Aufforderungswörter führen zu einer semantischen Verwässerung Kontrollieren Sie Aufforderungswörter auf 20–40 Wörter, konzentrieren Sie sich auf den Kern Teilen Sie Eingabeaufforderungswörter auf, generieren Sie sie mehrmals und synthetisieren Sie sie dann
Einhaltung des Urheberrechts Erstellte Bilder enthalten urheberrechtlich geschützte Elemente Verwenden Sie keine urheberrechtlich geschützten IP-Namen Verwenden Sie „--no“, um urheberrechtlich geschützte Elemente auszuschließen, ggf. rechtliche Prüfung
Lieferverzögerung Unendliche Divergenz in der Stilerkundungsphase Zeitraum-Zugriffskontrolle festlegen: Stilrichtung innerhalb von 24 Stunden sperren Obligatorische Verwendung von --sref zur Reduzierung des Suchraums
Charakterdrift Derselbe Charakter ist in verschiedenen Szenen inkonsistent Erstellen Sie eine --cref-Referenzgalerie Erhöhen Sie die Anzahl der Referenzbilder und verringern Sie den --cw-Wert

7.4 Investitionsanalyse

Kostenposition Schätzbereich Beschreibung
Midjourney-Abonnement 10–60 $/Monat Basisversion 200 Fotos/Monat, Pro-Version unbegrenzt
Designer-Lernzyklus 2–4 Wochen Von Grund auf bis zur unabhängigen Produktion kommerzieller Werke
Postproduktionstools 0–13 $/Monat Die kostenlose Version von Canva AI reicht aus, die Pro-Version kostet 13 $/Monat
Schnelle Wortverwaltung Kostenlos Verfügbar mit GitHub/GitLab/Notion
Gesamtkosten für ein einzelnes Bild 0,02–0,50 $/Bild Hängt von der Anzahl der Upscales und der Fehlergenerierungsrate ab

7.5 FAQ

F: Wie wähle ich zwischen Midjourney und Stable Diffusion? A: Midjourney zeichnet sich durch seine hohe Qualität und sein künstlerisches Gefühl aus, sodass es sich für eine schnelle Produktion und Stilerkundung eignet. Stable Diffusion zeichnet sich durch Open-Source-Steuerbarkeit und ComfyUI-Workflow aus, der für Szenarien geeignet ist, die eine feine Steuerung der lokalen Generierung erfordern. Es wird empfohlen, dass kommerzielle Projekte Midjourney als Hauptwerkzeug verwenden und komplexe Syntheseszenen durch SD ergänzt werden.

F: Wie können die durch Midjourney verursachten Hand-/Detailfehler behoben werden? A: Midjourney V7 hat die Handgenauigkeit erheblich verbessert, weist jedoch immer noch gelegentliche Probleme auf. Lösung: Fügen Sie dem Aufforderungswort eine Hand-/Detailbeschreibung hinzu (z. B. „Hände in Taschen“, um die Hände zu verbergen). oder verwenden Sie Photoshop AI, um es später zu reparieren; Sie können das Bild auch in Leonardo AI importieren und es mit AI Canvas teilweise neu zeichnen.

F: Wie kann die Stilkonsistenz aufrechterhalten werden, wenn man über einen längeren Zeitraum dieselbe Marke verwendet? A: Richten Sie drei Kernressourcen ein: (1) Markenstil-Referenzbibliothek (--sref-Bild), auf die bei jeder Generierung verwiesen wird; (2) Markenparametervorlage (lock --s, --sw, --style raw usw.), um die Konsistenz der Parameterebene sicherzustellen; (3) Markenprodukt-/Rollenreferenzbibliothek (--cref picture) zur Pflege des Serienimages.

F: Wie kann ich Midjourney-Assets in der Teamzusammenarbeit teilen? A: Empfohlene Lösung: Öffnen Sie einen teamspezifischen Kanal auf dem Discord-Server. Alle generierten Datensätze werden automatisch beibehalten. Gleichzeitig wird in Notion oder Feishu eine Datenbank mit Eingabeaufforderungswörtern eingerichtet, damit Teammitglieder sie wiederverwenden und iterieren können. Der Relax-Modus des Pro-Abonnements eignet sich für die gleichzeitige Arbeit mehrerer Teammitglieder.

F: Wie können die Kosten bei der Produktion in Chargen gesenkt werden? A: Verwenden Sie den Relax-Modus (unbegrenzte Generierung, aber Warteschlangenzeit) anstelle des Fast-Modus (Abrechnung nach GPU-Zeit). Verwenden Sie zunächst den Relax-Modus, um durch viele Versuche die optimale Richtung zu finden, und verwenden Sie dann den Fast-Modus, um schnell die endgültige Version zu erstellen.

7.6 Zusammenfassung der Vor- und Nachteile

Vorteile:

  • Funktioniert sofort, keine Investition in GPU-Hardware erforderlich – Künstlerischer Ausdruck und kompositorische Ästhetik stehen an erster Stelle unter den KI-Bilderzeugungswerkzeugen
  • Die Stilreferenz- (--sref) und Rollenreferenzmechanismen (--cref) sind ausgereift
  • Die Gemeinschaftsökologie ist aktiv, mit reichhaltigen Ressourcen für schnelles Wort und Unterricht
  • Modelliteration ist weiterhin führend, V7 hat eine große Anzahl von Schwachstellen in früheren Versionen behoben

Einschränkungen: – Läuft in einer Closed-Source-Cloud und kann nicht lokal bereitgestellt werden

  • Nicht gut in der präzisen Texterstellung und logischen Anordnung
  • Die Detailkontrolle bei hoher Stilisierung ist nicht so gut wie bei ComfyUI – Hängt vom Discord-Ökosystem ab und erfordert zusätzliche Brücken zur Integration in Unternehmensdesignsysteme
  • Die Abonnementgebühr ist niedriger als beim SD-Selbsthosting, aber höher als das kostenlose Kontingent einiger Konkurrenzprodukte

7.7 Ausblick

Midjourney entwickelt sich von einem „Hochleistungsmodell zur Bilderzeugung“ zu einer „Plattform für die visuelle Erstellung mit vollem Funktionsumfang“. Die Einführung der Alpha-Webversion (Unterstützung von Bildbearbeitung, Canvas-Interaktion, Teamzusammenarbeit) bedeutet, dass zukünftige Arbeitsabläufe unabhängig von Discord sein können. In Kombination mit dem integrierten Editor, der teilweisen Neuzeichnung, der schnellen Wortsuche und anderen Funktionen deckt Midjourney nach und nach die gesamte Verbindung von der Konzeptskizze bis zur Lieferung des fertigen Produkts ab. Für Designer und Kreativteams gab es noch nie einen besseren Zeitpunkt, die Workflow-Funktionen von Midjourney auszubauen.

Benutzerbewertungen

  • Bewertungen werden geladen...