Transkription: Audio und Video in Text verwandeln
Wie die Transkription im KI-Workplace funktioniert, welche Sprachen unterstützt werden und wie du Transkripte ins Materialien-Panel oder in eine Collection übernimmst.
Mit der Transkription wandelst du Audio- oder Videodateien automatisch in Text um, einfach indem du sie in den Chat lädst. Das funktioniert in vielen Sprachen, läuft auf EU-Infrastruktur und ist DSGVO-konform. Ein einstündiges Meeting wird so in wenigen Minuten zum durchsuchbaren, weiterverarbeitbaren Transkript.
Wofür du die Transkription nutzt
Typische Einsatzszenarien:
- Meeting-Aufzeichnungen in ein Protokoll umwandeln, das du im Nachgang teilen oder durchsuchen kannst.
- Interviews und Gespräche in Text bringen, um Aussagen wörtlich zitieren oder analysieren zu lassen.
- Podcasts, Webinare oder Video-Schulungen in eine durchsuchbare Wissensquelle verwandeln.
- Sprachnotizen automatisch ausschreiben, statt sie selbst zu tippen.
Im Hintergrund läuft die Adacor-gehostete Whisper V3 Large, also die höchste Sicherheitsstufe. Es gibt keine Modell-Auswahl für dich, alle Transkriptionen laufen über dieselbe Engine. Transkribiert wird standardmäßig auf Deutsch; eine andere Sprache lässt sich bei Bedarf angeben. Mehr zu den verfügbaren Modellen im Modelle-Guide.
Wie eine Transkription abläuft
Du brauchst keinen eigenen Befehl und keinen separaten Bereich. Es reicht, die Datei wie jede andere Datei in den Chat zu laden und die Nachricht abzuschicken:
- Datei hochladen: Klick im Chat-Eingabefeld auf die Büroklammer oder zieh die Audio- oder Videodatei direkt ins Chat-Fenster.
- Nachricht abschicken: Die Transkription startet erst beim Absenden, nicht schon beim Hochladen. Danach erkennt der KI-Workplace das Format und transkribiert die Datei. Bei kurzen Aufnahmen dauert das Sekunden, bei langen Meetings ein paar Minuten.
- Ergebnis im Chat und im Materialien-Panel: Das fertige Transkript erscheint im Chat. Die Original-Datei und das Transkript werden zusätzlich als eigene Einträge im Materialien-Panel oben rechts gespeichert (Fähnchen-Symbol).
📌 Nichts passiert nach dem Hochladen? Das ist normal. Solange die Nachricht im Eingabefeld steht, wartet die Datei nur. Schick sie ab, dann läuft die Transkription los.
Unterstützte Audio- und Video-Formate
Die Transkription funktioniert mit allen gängigen Audio-Formaten und auch mit Videodateien: Bei Videos wird automatisch die Audio-Spur transkribiert.
- Audio: MP3, WAV, FLAC, WebM, OGG, M4A
- Video: MP4 (Audio-Spur)
Formate wie WebM, OGG und M4A werden vor der Transkription im Hintergrund automatisch in MP3 konvertiert. Du musst also nichts vorab umwandeln.
💡 Tipp: Wenn du eine besonders große Aufnahme hast (z.B. ein zweistündiges Webinar als WAV), exportier vor dem Upload eine MP3-Variante. MP3 ist deutlich kleiner und reduziert die Wartezeit beim Hochladen.
Limits und Kontingente
Für Transkription gibt es ein monatliches Kontingent (gemessen in Transkriptions-Minuten), das in eurer Organisation als gemeinsamer Pool geführt wird. Alle Transkriptionen aller User zählen in denselben Topf. Das macht Spitzen einzelner Personen unkritisch, solange die Organisation insgesamt im Rahmen bleibt.
So funktioniert die Verbrauchs-Logik:
- Preflight-Längenmessung: Beim Upload wird die Länge der Audio-/Video-Datei gemessen, bevor die Transkription startet. Würde die Datei den verbleibenden Monats-Pool sprengen, lehnt der Workplace sie ab, bevor Rechenzeit verbraucht wird.
- Live-Quotenprüfung: Während längere Transkriptionen laufen, wird der verbleibende Pool laufend mitgeführt. So gibt’s keine Überraschungen am Monatsende.
- Frühwarnung im Frontend: Wenn der Pool sich der oberen Grenze nähert, wird im Upload-Dialog frühzeitig gewarnt. Du siehst rechtzeitig, dass es eng wird, statt erst beim Abbruch zu merken, dass kein Kontingent mehr da ist.
Reicht das monatliche Kontingent nicht aus, können Administrator:innen es erweitern: unter Administration → Buchungen in der Karte Whisper-Transkription lässt sich im Bereich Whisper-Kontingenterweiterungen zusätzliches Kontingent in 5-Stunden-Schritten freischalten. Eine Erweiterung ist eine Obergrenze, abgerechnet wird nur der tatsächliche Verbrauch.
Die konkrete Pool-Größe pro Organisation steht auf der Seite Limits & Kontingente. Administrator:innen sehen den aktuellen Verbrauch in den Admin-Einstellungen unter STT-Kontingent.
Pro Datei gilt ein Limit von 50 MB. Bei längeren Aufnahmen hilft es, die Datei vorher zu komprimieren oder in Teile zu schneiden. Eine MP3-Variante einer langen WAV-Aufnahme ist meist deutlich kleiner und bleibt eher unter der Grenze.
Sprachen
Die Transkription unterstützt eine breite Palette an Sprachen, von Deutsch und Englisch über Französisch und Spanisch bis hin zu Arabisch, Mandarin und vielen weiteren. Standardmäßig wird auf Deutsch transkribiert. Ist die Aufnahme in einer anderen Sprache, kannst du die Sprache bei der Anfrage angeben.
💡 Tipp: Bei fremdsprachigen Aufnahmen gib die Sprache am besten direkt mit an, damit das Transkript sauber wird.
Mit dem Transkript weiterarbeiten
Sobald das Transkript im Chat steht, kannst du wie mit jeder anderen Antwort weiterarbeiten:
- Zusammenfassen lassen: Schreib zum Beispiel „Fasse die wichtigsten Punkte aus dem Transkript zusammen.“
- Aktionen ableiten: „Schreib eine ToDo-Liste mit allen Aufgaben, die im Meeting verteilt wurden.“
- Übersetzen: „Übersetze das Transkript ins Englische.“
- Exportieren: Über das Download-Symbol oben rechts im Chat kannst du den gesamten Verlauf inklusive Transkript herunterladen, zum Beispiel als Markdown, PDF, Word oder Excel.
Transkripte in der Knowledge Base nutzen
Du kannst die Original-Datei oder das Transkript direkt aus dem Materialien-Panel in eine Collection deiner Knowledge Base übernehmen. Klick im Panel oben rechts auf den jeweiligen Eintrag und nutze Zu Collection hinzufügen. So wird das Transkript für dein Team durchsuchbar und steht der KI als Wissensquelle zur Verfügung. Sinnvoll zum Beispiel für regelmäßige Meeting-Reihen, Podcast-Folgen oder Webinare, deren Inhalte ihr später nochmal nachschlagen wollt.
Mehr dazu im Knowledge-Base-Guide.
Tipps für gute Transkripte
- Aufnahmequalität zählt. Klare Aufnahmen ohne starke Hintergrundgeräusche werden deutlich genauer transkribiert. Wenn möglich, externes Mikrofon statt Laptop-Mikrofon nutzen.
- Eigennamen kontrollieren. Whisper transkribiert Eigennamen oft phonetisch. Schau bei Personennamen, Firmennamen oder Fachbegriffen drüber, bevor du das Transkript weitergibst.
- Lange Aufnahmen vorab teilen. Sehr lange Dateien (mehrere Stunden) lassen sich einfacher in Etappen verarbeiten. Bei Bedarf vorher in Abschnitte schneiden.
War dieser Guide hilfreich?
Deine Rückmeldung fließt direkt in die nächste Überarbeitung ein.