🗓 Save the Date KI-Snack Week 2026 – Das KI-Event für Macher & Entscheider · 09.–13. November 2026 · München + Online Jetzt anmelden →
Tipps & Tricks

Kostenlose Transkription mit Speakr verfügbar

6 min Lesezeit
Kostenlose Transkription mit Speakr verfügbar

Die Nutzung von Transkriptionsdiensten hat sich in den letzten Jahren erheblich verändert.

„Die Möglichkeit, Transkriptionen selbst zu hosten, gibt uns die Kontrolle über unsere Daten und schützt unsere Privatsphäre“, erklärt ein Nutzer, der regelmäßig mit sensiblen Informationen arbeitet.

Während viele auf kostenpflichtige Abonnements angewiesen sind oder Stunden mit manueller Transkription verbringen, gewinnt eine dritte Option zunehmend an Beliebtheit: die Verwendung einer eigenen Transkriptionsplattform auf eigener Hardware.

Einführung in Speakr

Speakr ist eine kostenlose, quelloffene und selbstgehostete Transkriptionsplattform, die von dem Entwickler Murtaza Nasir ins Leben gerufen wurde. Sie verwandelt Audioaufnahmen in organisierte, durchsuchbare und KI-zusammengefasste Notizen. Für Fachleute, die regelmäßig mit sensiblen Interviews, vertraulichen Besprechungen oder NDA-geschützten Diskussionen umgehen, ist es von großer Bedeutung, dass ihre Audioinhalte nicht auf Servern Dritter gespeichert werden.

Kosten und Konfiguration

Es ist wichtig zu beachten, dass Speakr selbst kostenlos und quelloffen ist. Allerdings basieren die meisten Transkriptions-Backends auf externen APIs (wie OpenAI, AssemblyAI und Deepgram), die Gebühren pro Minute erheben. Die einzige Konfiguration, die die API-Kosten vollständig eliminiert, ist das selbstgehostete WhisperX-Backend, das lokal betrieben wird, jedoch eine GPU erfordert. Diese Anleitung wird Ihnen helfen, die verschiedenen Optionen zu verstehen und die richtige Konfiguration für Ihre Bedürfnisse auszuwählen.

Schritt 1: Verständnis von Speakr

Bevor Sie mit der Installation beginnen, ist es hilfreich zu verstehen, welches Problem Speakr löst und warum die Selbsthostung den zusätzlichen Aufwand wert ist. Kommerzielle Transkriptionstools wie Otter.ai funktionieren gut, haben jedoch ihre Einschränkungen. Die kostenlose Version von Otter.ai begrenzt die Nutzer auf 300 Transkriptionsminuten pro Monat, während der Pro-Plan 16,99 USD pro Benutzer und Monat kostet. Wichtiger ist, dass Ihre Audioinhalte auf externen Servern verarbeitet und gespeichert werden, was für Journalisten und Forscher, die unter Geheimhaltungsvereinbarungen arbeiten, oft nicht akzeptabel ist.

Die Vorteile von Speakr

Speakr umgeht diese Einschränkungen. Da es auf Ihrer eigenen Infrastruktur läuft, gibt es keine monatlichen Minutenlimits, abgesehen von dem, was Ihre Hardware bewältigen kann. Bei Verwendung eines selbstgehosteten Backends wie WhisperX verlässt Ihre Audioaufnahme niemals Ihr Gerät. Speakr ist eine Multi-Backend-Plattform, die mehrere Transkriptionsanbieter unterstützt, darunter die OpenAI Whisper-Modellfamilie, die OpenAI-API, Deepgram, AssemblyAI und andere. Die Whisper-Modellfamilie nutzt dieselbe Spracherkennungstechnologie, die auch hinter vielen kommerziellen Transkriptionsprodukten steht, sodass die Genauigkeit mit bezahlten Diensten vergleichbar ist.

Schritt 2: Einrichtung Ihrer Umgebung

Die Hauptabhängigkeit von Speakr ist Docker. Wenn Sie Docker noch nie verwendet haben, wird Ihnen dieser Schritt die notwendigen Grundlagen vermitteln, um das Tool zum Laufen zu bringen, ohne dass Sie ein Container-Experte werden müssen. Beginnen Sie mit der Installation von Docker Desktop für Ihr Betriebssystem. Docker Desktop umfasst sowohl die Docker Engine als auch Docker Compose, die beiden Werkzeuge, auf die sich der schnelle Start von Speakr stützt.

Installation und Konfiguration

Sobald Docker läuft, folgen Sie diesen Schritten zur Installation:

  • mkdir speakr && cd speakr
  • wget https://raw.githubusercontent.com/murtaza-nasir/speakr/master/config/docker-compose.example.yml -O docker-compose.yml
  • wget https://raw.githubusercontent.com/murtaza-nasir/speakr/master/config/env.transcription.example -O .env

Dies lädt die Konfigurationsdateien von Speakr in ein lokales Verzeichnis herunter. Öffnen Sie dann die .env-Datei, um Ihre Konfiguration einzurichten:

nano .env

Mindestens müssen Sie die Admin-Zugangsdaten und Ihre API-Schlüssel festlegen. Die offiziellen Dokumente kennzeichnen die Admin-Zugangsdaten als erforderlichen Schritt vor dem ersten Start:

ADMIN_USERNAME=your-username
ADMIN_EMAIL=you@example.com
ADMIN_PASSWORD=a-strong-password
TRANSCRIPTION_API_KEY=sk-your-openai-key
TEXT_MODEL_API_KEY=your-openrouter-or-openai-key

Überspringen Sie die Admin-Zugangsdaten nicht. Die Standardwerte (admin / changeme) stellen ein Sicherheitsrisiko dar, insbesondere auf Maschinen, die über ein Netzwerk zugänglich sind.

Starten Sie dann die Anwendung:

docker compose up -d

Speakr ist unter http://localhost:8899 erreichbar, sobald die Container gestartet sind. Die vollständige Installationsanleitung finden Sie auf der offiziellen Speakr-Dokumentationsseite.

Wahl des Transkriptions-Backends

Die connectorbasierte Architektur von Speakr ermöglicht es Ihnen, Transkriptions-Engines auszutauschen, ohne die Nutzung des Rest der Anwendung zu ändern. Ihre Wahl des Backends beeinflusst die Privatsphäre, die Kosten und die Genauigkeit, daher ist es wichtig, die Optionen zu verstehen, bevor Sie sich für eine Konfiguration entscheiden.

  • OpenAI Transcribe: API-Schlüssel erforderlich, kostenpflichtig nach Nutzung, Speaker-Diarization verfügbar, keine Sprachprofile.
  • WhisperX (selbstgehostet): GPU + Container erforderlich, kostenlos nach Hardware, beste Qualität, Sprachprofile verfügbar.
  • AssemblyAI: API-Schlüssel erforderlich, kostenpflichtig nach Nutzung (kostenlose Credits), Speaker-Diarization verfügbar, keine Sprachprofile.
  • Deepgram: API-Schlüssel erforderlich, kostenpflichtig nach Nutzung, Speaker-Diarization verfügbar, keine Sprachprofile.

WhisperX ist die einzige selbstgehostete Option hier. Es erfordert eine GPU und eliminiert laufende API-Kosten, sobald es bereitgestellt ist, was es zur Konfiguration macht, die sowohl vollständige Datenschutz als auch null Betriebskosten bietet.

Audio aufnehmen und transkribieren

Mit Speakr im Betrieb deckt dieser Schritt die drei Hauptmethoden ab, um Audio in das System zu bringen und was passiert, sobald es dort ist.

  • Option A: Direkt im Browser aufnehmen: Die Weboberfläche von Speakr enthält einen Recorder, der von Ihrem Mikrofon, dem Systemaudio Ihres Computers oder einer Mischung aus beidem aufnimmt.
  • Option B: Hochladen vorhandener Dateien: Ziehen Sie Audio- oder Videodateien direkt in die Benutzeroberfläche. Speakr verarbeitet die Formatkonvertierung intern über FFmpeg.
  • Option C: Automatisches Importieren über einen überwachten Ordner: Legen Sie Dateien in einen bestimmten Ordner auf Ihrem Server ab, und Speakr verarbeitet sie automatisch.

Sobald eine Aufnahme verarbeitet wurde, erstellt Speakr:

  • Ein vollständiges Transkript mit klickbaren Zeitstempeln.
  • Eine KI-generierte Zusammenfassung mit wichtigen Punkten und nächsten Schritten.
  • Speaker-labeled turns, wenn die Diarisierung aktiviert ist.
  • Ein automatisch generierter Titel.

Organisation Ihrer Transkriptionsbibliothek

Mit wachsender Anzahl an Transkripten werden die organisatorischen Funktionen von Speakr immer wichtiger. Dieser Schritt behandelt die verfügbaren Werkzeuge zur Strukturierung und Auffindbarkeit von Aufnahmen.

Ordner und Tags sind die beiden primären organisatorischen Ebenen. Ordner funktionieren wie erwartet. Tags gehen weiter: Jeder Tag kann seine eigene KI-Aufforderung und Transkriptionseinstellungen tragen, sodass die Anwendung eines Tags die Art und Weise ändert, wie Speakr Aufnahmen in dieser Kategorie verarbeitet und zusammenfasst.

Zusammenarbeit und Teilen

Speakr unterstützt Multi-User-Setups, was es für kleine Teams und Forschungsgruppen geeignet macht. Gruppen ermöglichen es Ihnen, einen gemeinsamen Arbeitsbereich zu schaffen, in dem Aufnahmen, die mit einem Gruppentag versehen sind, automatisch für jedes Gruppenmitglied sichtbar sind.

Fazit

Speakr ist eine leistungsfähige Transkriptionsplattform, die kostenlos und quelloffen ist. Die Investition in die Einrichtung ist real, aber die Vorteile in Bezug auf Datenschutz und Kostenersparnis sind erheblich. Beginnen Sie mit dem schnellen Docker-Start, verarbeiten Sie einige Ihrer eigenen Aufnahmen und lassen Sie das Tool sich beweisen, bevor Sie Zeit in die erweiterten Konfigurationen investieren.


Quellen: kdnuggets

Bildquelle: KI generiert

Dieser Text wurde mit Hilfe von künstlicher Intelligenz in Zusammenarbeit mit unserer Redaktion erstellt.

🚀
KI-Snack Week 2026 · 09.–13. November
Das KI-Event für Macher & Entscheider
2 Tage live in München + 3 Tage Online-Masterclasses · Jetzt Ticket sichern
Mehr erfahren →
KI Snack