
Diktieren im Arbeitsalltag: Der Text muss auch am richtigen Ort ankommen
Ein Gedanke lässt sich manchmal leichter aussprechen als tippen. Praktisch wird das, wenn der Text danach direkt dort steht, wo man arbeitet. Dafür habe ich HandsOff entwickelt: mit Hotkey, Transkription, KI-Nachbearbeitung und Übersetzung. Die Spracherkennung ist dabei nur ein Teil der Aufgabe.
Recherchestand: 2026-09-11 · Titelbild: KI-generierte Illustration
Es muss sichtbar sein, ob aufgenommen wird
Eine Aufnahme braucht einen erkennbaren Zustand und eine zuverlässige Stop-Möglichkeit. Niemand sollte minutenlang sprechen und erst danach merken, dass der Hotkey nicht ausgelöst hat. Diese Rückmeldung gehört für mich zur Grundbedienung.
Im Browser verlangt getUserMedia eine Berechtigung und einen sicheren Kontext. Für Desktop-Anbindungen gelten die jeweiligen Plattformregeln. Verweigerter Zugriff, ein fehlendes Mikrofon und ein Gerätewechsel brauchen deshalb eigene Prüfungen.
Korrigierter Text darf seine Bedeutung nicht ändern
Ein Transkript erfasst das Gesagte. Danach kann eine KI Satzzeichen ergänzen, Füllwörter entfernen oder übersetzen. Dabei darf aus einer vorsichtigen Aussage nicht plötzlich eine feste Zusage werden. Ein schönerer Satz ist nicht automatisch der richtige Satz.
Für Testdiktate eignen sich Namen, Fachbegriffe, Zahlen und Verneinungen. Original und überarbeitete Fassung sollten vergleichbar bleiben. Ein persönliches Wörterbuch hilft gezielt bei Begriffen, die häufig vorkommen.
Die Entscheidung im Überblick
- 01AufnahmeZustand und Abbruch sichtbar
- 02TextBedeutung vor Stil prüfen
- 03ÜbergabeIns richtige Feld einfügen
In die nächste Anwendung wechseln, ohne den Text zu verlieren
HandsOff fügt den Text ins aktive Feld ein. Eine diktierte Nachricht muss damit nicht erst durch mehrere Fenster kopiert werden. Einfügen und Absenden bleiben trotzdem verschiedene Schritte: Der vorbereitete Text wurde dadurch noch nicht verschickt.
Interessant ist auch der Fall, dass während der Verarbeitung ein anderes Fenster aktiv wird. Die Ausgabe darf nicht überraschend am falschen Ort landen. Hier hilft eine verständliche Rückmeldung mehr als eine etwas schnellere Erkennung.
Den tatsächlichen Datenweg klären
Vor dem Einsatz muss klar sein, wo Audio verarbeitet wird, welche Dienste beteiligt sind und ob ein Verlauf gespeichert wird. Eine Desktop-App bedeutet nicht automatisch, dass auch das Sprachmodell auf dem Gerät läuft. Das hängt von der konkreten Konfiguration ab.
Für eine eigene Spracheingabe starten wir am besten mit typischen Sätzen und den Anwendungen, in denen das Team arbeitet. An diesen Beispielen lassen sich Erkennung und Bedienung gemeinsam prüfen. Das Ziel ist nutzbarer Text an der richtigen Stelle.
