Marker und Whiteboard
Strichzeichnungen
Farbige Illustration
Geschäftliches und Diagramme
Dunkle Tafeln
Mit E-Mail anmelden
Wofür generative Videomodelle entwickelt wurden, wo sie beim Unterrichten und Erklären an Grenzen stoßen und wann ein gesprochenes Whiteboard-Video besser passt. Alle Modellangaben stammen von den Anbieterseiten und wurden am 23. September 2026 geprüft.
Generative Videomodelle verwandeln einen Prompt in einen kurzen, filmisch wirkenden Clip mit Ton. Eine Generierung dauert Sekunden, nicht Minuten: 8 Sekunden bei Veo 3.1, 15 bei Kling VIDEO 3.0 und MiniMax H3, 30 bei Seedance 2.5. Ein Erklärvideo besteht meist aus mehreren Minuten gesprochenem Text, bei dem jedes Bild zum gesprochenen Satz passen muss. Wer es aus Clips erstellt, braucht für jede Einstellung einen Prompt, muss das Aussehen konsistent halten, die Clips verbinden und das Voiceover selbst synchronisieren. Ein Whiteboard-Generator geht stattdessen vom Skript aus und zeichnet zu jedem gesprochenen Satz ein Bild. StrokeVideo ist ein Whiteboard-Generator, kein solches Modell, und bietet keinen Zugang zu diesen Modellen.
OpenAI startete Sora 2 am 30. September 2025 als Videomodell mit synchronisiertem Dialog und Soundeffekten sowie einer Sora-App. Im Hilfecenter von OpenAI steht inzwischen, dass die Sora-Web- und App-Versionen am 26. April 2026 eingestellt wurden und die Sora-API am 24. September 2026 eingestellt wird. In der API-Dokumentation sind sora-2 und sora-2-pro als veraltet gekennzeichnet. Solange der Dienst lief, erstellte die API Clips von bis zu 20 Sekunden, die sechsmal auf bis zu 120 Sekunden verlängert werden konnten. Echte Personen, urheberrechtlich geschützte Figuren und urheberrechtlich geschützte Musik wurden abgelehnt. Wenn Sie heute ein Tool für Erklärvideos auswählen, ist Sora keine Option. Quellen, geprüft am 23. September 2026: https://openai.com/index/sora-2/ ; https://help.openai.com/en/articles/20001152-what-to-know-about-the-sora-discontinuation ; https://developers.openai.com/api/docs/guides/video-generation
Google DeepMind bezeichnet Veo 3.1 als sein führendes Videogenerierungsmodell. Es erzeugt Audio nativ, kann Dialoge einbinden und ist in der Gemini-App, Google Flow, Google Vids, Google AI Studio und der Gemini API verfügbar. Die Dokumentation der Gemini API nennt Clip-Längen von 4, 6 oder 8 Sekunden; 1080p und 4K sind nur bei 8 Sekunden verfügbar. Ein Veo-Video lässt sich bis zu 20-mal um jeweils 7 Sekunden verlängern, also auf höchstens 148 Sekunden. Es ist nicht kostenlos: Auf der Preisseite der Gemini API steht für Veo 3.1, Veo 3.1 Fast und Veo 3.1 Lite „Free Tier: Not available“. Je nach Variante und Auflösung kostet eine Videosekunde 0,05 bis 0,60 US-Dollar. Auf der Seite mit den Google-KI-Tarifen ist Videogenerierung in der Gemini-App den kostenpflichtigen Tarifen Plus, Pro und Ultra zugeordnet, nicht dem kostenlosen Tarif. Google weist außerdem darauf hin, dass natürliches, konsistentes gesprochenes Audio, besonders bei kurzen Sätzen, noch entwickelt wird. Quellen, geprüft am 23. September 2026: https://deepmind.google/models/veo/ ; https://ai.google.dev/gemini-api/docs/veo ; https://ai.google.dev/gemini-api/docs/pricing ; https://gemini.google/subscriptions/
Klings Anleitung zu VIDEO 3.0 vom 6. Februar 2026 nennt eine Generierungsdauer von 3 bis 15 Sekunden. Ein Modus mit mehreren Einstellungen plant Schnitte und Kamerawinkel. Die Elementbindung hält die Hauptfigur über mehrere Einstellungen hinweg konsistent, und natives Audio unterstützt Dialoge auf Chinesisch, Englisch, Japanisch, Koreanisch und Spanisch. Kling ist außerdem der einzige Anbieter hier, der eine Aussage zu Text macht: Das Modell hält Text aus einem hochgeladenen Bild, etwa ein Schild, eine Beschriftung oder ein Logo, konsistent. Auf der Kling-Mitgliedschaftsseite ist ein kostenloser Basic-Tarif aufgeführt. Wasserzeichen entfernen, die Ausgabe kommerziell nutzen sowie in 1080p oder 4K generieren gehören zu den Vorteilen der kostenpflichtigen Tarife. Quellen, geprüft am 23. September 2026: https://kling.ai/quickstart/klingai-video-3-model-user-guide ; https://kling.ai/app/membership/membership-plan
ByteDance Seed beschreibt Seedance 2.5 als Audio-Videomodell für Geschichten von 30 Sekunden: bis zu 30 Sekunden pro Generierung, mit der Möglichkeit, zweimal zu verlängern, außerdem die Bearbeitung generierter Videos und die Steuerung durch Referenzvideos. BytePlus, das die API verkauft, nennt Laufzeiten von 4 bis 30 Sekunden in 480p oder 720p. Die Prepaid-Tarife unterstützen bis zu 50 Referenzbilder, -videos und -audio clips. Auf keiner der beiden Seiten ist ein kostenloses Kontingent angegeben. Quellen, geprüft am 23. September 2026: https://seed.bytedance.com/en/seedance2_5 ; https://www.byteplus.com/en/product/seedance
Auf der Hailuo-AI-Seite zu MiniMax H3, das laut Anbieter auch Hailuo 3 genannt wird, werden Clips von 5 bis 15 Sekunden mit 24 Bildern pro Sekunde, nativem Stereoton und einer Ausgabe bis 1440p genannt. Außerdem lassen sich Personen und Objekte ersetzen oder entfernen und Dialoge in einem bestehenden Clip ändern. Auf dieser Seite gibt es keinen dauerhaft kostenlosen Tarif. Angeboten wird eine Aktion für neue Nutzer: Zum Zeitpunkt unserer Prüfung umfasste sie 3 kostenlose H3-Tests und 3.000 Credits für den Download der MiniMax-Design-App. Quelle, geprüft am 23. September 2026: https://hailuoai.video/tools/minimax-h3
Drei Dinge stehen im Weg. Länge: Eine fünfminütige Unterrichtsstunde erfordert Dutzende separate Generierungen. Text: Keine der von uns gelesenen Seiten zu Sora 2, Veo 3.1, Seedance 2.5 oder MiniMax H3 sagt, wie zuverlässig Wörter, Beschriftungen oder Formeln lesbar erscheinen, wenn sie im Prompt stehen. Klings Aussage bezieht sich auf Text aus einem hochgeladenen Bild. Testen Sie daher, bevor Sie sich darauf verlassen. Konsistenz und Kosten: Eine Figur oder ein Diagramm über mehrere Einstellungen hinweg gleich zu halten, erfordert Referenzbilder oder Elemente, und jede Sekunde kostet Geld – auch verworfene Aufnahmen. Verwenden Sie ein generatives Modell, wenn der Zuschauer etwas Reales oder Filmisches sehen soll: ein Produkt in Bewegung, einen Ort, eine kurze Einleitung oder eine sprechende Figur. Verwenden Sie ein Whiteboard, wenn die Erklärung im Mittelpunkt steht. Bei StrokeVideo fügen Sie Ihr Skript ein oder geben ein Thema ein, zu dem das Tool eines schreibt. Für jeden Satz wird ein Bild gezeichnet, Strich für Strich passend zur gesprochenen Erzählung in 14 Sprachen. Anschließend laden Sie eine MP4 ohne Wasserzeichen herunter. 1 Video pro Tag ist kostenlos, bis zu 4 Minuten; ein Tarif erlaubt bis zu 15 Minuten pro Video. StrokeVideo erstellt kein realistisches Filmmaterial, keine bewegten Figuren und keinen lippensynchronen Dialog.
Die Seite stammt vom StrokeVideo-Team, das Whiteboard-Videos erstellt. Lesen Sie die Empfehlung daher mit diesem Hintergrund. Jede Aussage zu Sora 2, Veo, Kling, Seedance und Hailuo stammt von der Website oder Dokumentation des jeweiligen Anbieters, die am 23. September 2026 geöffnet wurde. Die Adressen stehen in den einzelnen Abschnitten. Wenn auf den Anbieterseiten etwas nicht erwähnt wurde, etwa ein kostenloses Kontingent für Seedance 2.5 oder die Zuverlässigkeit von Text aus einem Prompt, sagen wir das ausdrücklich, statt Angaben aus Drittanbieter-Tests oder Bestenlisten zu übernehmen. Diese Produkte ändern sich alle paar Monate. Informieren Sie uns daher, wenn etwas hier nicht mehr aktuell ist.
| Modell | Längste einzelne Generierung (Angabe des Anbieters) | Kostenlose Option (laut Anbieter) | Lesbarer Text im Bild | Am besten geeignet für |
|---|---|---|---|---|
| Sora 2 (OpenAI) | 20 Sekunden in der API, auf bis zu 120 Sekunden verlängerbar | Eingestellt: Die App wurde am 26. April 2026 geschlossen, die API wird am 24. September 2026 eingestellt | Auf den OpenAI-Seiten keine Aussage zur Textqualität gefunden | Nicht für neue Projekte verfügbar |
| Veo 3.1 (Google) | 8 Sekunden; in der API in 7-Sekunden-Schritten auf 148 Sekunden verlängerbar | Nein: Videogenerierung ist Bestandteil der kostenpflichtigen Google-KI-Tarife, die API hat kein kostenloses Kontingent | Auf den Google-Seiten keine Aussage zur Textqualität gefunden | Realistische oder filmische Aufnahmen mit Soundeffekten und Dialog |
| Kling VIDEO 3.0 | 15 Sekunden | Ja, ein kostenloser Basic-Tarif; Wasserzeichen entfernen und kommerzielle Nutzung sind kostenpflichtige Vorteile | Behauptet, Text aus einem hochgeladenen Bild, etwa ein Schild oder Logo, konsistent beizubehalten; keine Aussage zu Text aus Prompts | Kurze Szenen mit mehreren Einstellungen, konsistenter Figur und Dialog |
| Seedance 2.5 (ByteDance) | 30 Sekunden, zweimal verlängerbar | Auf den gelesenen Seiten kein kostenloses Kontingent angegeben | Auf den ByteDance-Seiten keine Aussage zur Textqualität gefunden | Längere Einzelszenen und 30-Sekunden-Geschichten mit Referenzbildern, -videos und -audio |
| Hailuo (MiniMax H3) | 15 Sekunden | Aktion für neue Nutzer, kein dauerhaft kostenloser Tarif | Auf den MiniMax-Seiten keine Aussage zur Textqualität gefunden | Kurze Clips mit Stereoton sowie das Bearbeiten von Personen, Objekten oder Dialogen in einem Clip |
| StrokeVideo (Whiteboard, diese Website) | Bis zu 15 Minuten gesprochener Text in einem Video | 1 Video pro Tag, bis zu 4 Minuten, ohne Wasserzeichen | Kurze Beschriftungen werden in die Bilder gezeichnet, und ein gezeichnetes Wort kann falsch erscheinen; wichtige Stellen daher prüfen | Unterricht, Erklärvideos und Schulungen aus einem Skript, gesprochen in 14 Sprachen |
Nicht mehr. OpenAI hat die Sora-App und die Website am 26. April 2026 geschlossen und gibt an, dass die Sora-API am 24. September 2026 eingestellt wird. Solange sie verfügbar war, dauerte eine Generierung höchstens 20 Sekunden. Für eine Unterrichtsstunde mussten daher viele Clips verbunden und die Erzählung selbst hinzugefügt werden.
Laut den eigenen Google-Seiten vom 23. September 2026 nicht. Auf der Preisseite der Gemini API ist für Veo 3.1, Veo 3.1 Fast und Veo 3.1 Lite kein kostenloses Kontingent aufgeführt. Auf der Seite mit den Google-KI-Tarifen steht Videogenerierung in der Gemini-App unter den kostenpflichtigen Tarifen Plus, Pro und Ultra. Angebote ändern sich, prüfen Sie daher die Google-Tarifseite.
Es hängt davon ab, was die Zuschauer sehen müssen. Für eine realistische Szene, eine Produktaufnahme oder einen filmischen Einstieg eignet sich ein generatives Modell wie Veo 3.1, Kling, Seedance oder Hailuo. Wenn du einen Prozess, ein Konzept oder eine Lektion über mehrere Minuten Erklärung hinweg vermitteln möchtest, ist ein Whiteboard-Generator, der für jeden Satz deines Skripts ein Bild zeichnet, schneller erstellt und leichter zu verfolgen. Manche nutzen beides: einen kurzen generierten Clip zum Einstieg und ein Whiteboard für die Erklärung.
Laut den Anbietern pro Generierung: Veo 3.1 bis zu 8 Sekunden, Kling VIDEO 3.0 und MiniMax H3 bis zu 15 Sekunden, Seedance 2.5 bis zu 30 Sekunden. Veo und Seedance können einen Clip verlängern; in der Gemini API kann ein Veo-Video 148 Sekunden erreichen. Ein Whiteboard-Video von StrokeVideo kann in einem Durchgang bis zu 15 Minuten Sprechertext enthalten.
Keine der offiziellen Seiten, die wir zu Sora 2, Veo 3.1, Seedance 2.5 oder MiniMax H3 gelesen haben, erklärt, wie zuverlässig Text aus einem Prompt lesbar dargestellt wird. Der Leitfaden von Kling sagt, dass VIDEO 3.0 Text aus einem hochgeladenen Bild, etwa ein Schild oder Logo, konsistent beibehält. Wenn dein Erklärvideo von Beschriftungen, Formeln oder Untertiteln abhängt, solltest du es zuerst testen oder den Text später in einem Editor hinzufügen.
Nein. StrokeVideo verwendet keines der Modelle auf dieser Seite und bietet auch keinen Zugriff darauf. StrokeVideo erstellt eine bestimmte Art von Video: ein handgezeichnetes Whiteboard-Erklärvideo, das passend zum Sprechertext Strich für Strich gezeichnet wird.