HR Voice Agent
Führt das telefonische Erstgespräch, wertet es belegt aus und legt dem HR-Team ein entscheidungsreifes Protokoll in Slack ab.
- 70
- Nodes in 4 Workflows
- 6
- Bewertungsdimensionen
- ≈ 2 s
- Antwortzeit im Gespräch
- 1:7
- Kosten gegenüber Mensch
Meine Rolle
Testprojekt, vollständig ausgearbeitet und in Eigenregie umgesetzt: Konzept, Architektur, Gesprächs-Prompt, Bewertungslogik, die vier n8n-Workflows, der rechtliche Rahmen, die Dokumentation und die Vorführumgebung.
Art
Eigenentwicklung – Konzept, Umsetzung und Betrieb in Eigenregie.
Hinweis: Entstanden als vollständig ausgearbeitete Testaufgabe. Das Unternehmen, für das sie erstellt wurde, wird hier bewusst nicht genannt; Rufnummern, Kanalnamen und Zugangsdaten sind ausgelassen. Alle genannten Zahlen stammen aus abgelegten Prüfläufen gegen die echten Dienste.
Ausgangslage
Das Problem
Ein telefonisches Erstgespräch kostet im Recruiting immer dieselbe halbe Stunde – Termin finden, führen, Notizen tippen, weitergeben. Es automatisieren zu wollen ist der leichte Teil; der schwere ist, dass am Ende eine Personalentscheidung vorbereitet wird. Damit gelten Regeln, die für eine Pizzabestellung nicht gelten: Ein Sprachmodell, das Punktzahlen vergibt, darf nichts erfinden, es darf nicht nach Alter, Herkunft oder Akzent urteilen, und es darf niemanden vollautomatisch ablehnen. Dazu kommt die Aufzeichnung: Ohne freiwillige Einwilligung trägt die Verarbeitung nicht – und freiwillig ist eine Einwilligung nur, wenn es eine echte Alternative gibt.
Lösung
Der Ansatz
Die Aufgabenteilung ist bewusst scharf gezogen: Vapi macht Telefonie, Spracherkennung, die Echtzeit-Schleife und die Sprachsynthese; n8n orchestriert alles danach. Der Agent führt sechs Gesprächsphasen in 8 bis 12 Minuten – Werdegang, fachliche Tiefe, Motivation, Rahmenbedingungen, Rückfragen, Abschluss – und bewertet dabei nie. Er hört zu. Erst nach dem Auflegen läuft die Auswertung in drei getrennten Stufen: Extraktion („Was wurde gesagt?"), Bewertung („Wie gut ist das?") und Entscheidung („Was folgt daraus?"). Die ersten beiden Stufen macht ein Sprachmodell mit striktem JSON-Schema, die dritte rechnet JavaScript in n8n – der gewichtete Gesamtscore entsteht nie im Modell. Das Ergebnis geht als Block-Kit-Protokoll in den HR-Kanal, aus dem sich in etwa 15 Sekunden eine Entscheidung ableiten lässt.
Ergebnis
Was dabei herauskam
Vier importierbare n8n-Workflows mit zusammen 70 Nodes, ein durchkonfigurierter Assistent, ein Slack-Protokoll und sieben ausformulierte Fachantworten zu Bewertungslogik, Vapi-Einstellungen, Voice-Modellen, Latenz, eigener Transkript-Pipeline, EU-Datenschutz und AWS-Betrieb. Die Kette ist gegen die echten Dienste durchgelaufen und die Ausgabe abgelegt: Bewertung mit striktem Schema, deterministischer Score von 87 %, Slack nimmt die Struktur an. Dazu eine passwortgeschützte Next.js-Oberfläche, in der sich der Agent ohne Telefon direkt im Browser anrufen lässt und die Workflows im Original-Look zu sehen sind. Was fehlt, steht ebenso ausdrücklich in der Dokumentation wie das, was da ist – dreizehn bewusst nicht gebaute Punkte, jeder mit Begründung.
Funktionen
Was drin steckt
Der Agent urteilt nicht im Gespräch
Sechs Phasen, feste Reihenfolge, gleiche Fragen für alle. Bewertet wird ausschließlich danach, aus dem Transkript. Ein Modell, das schon währenddessen Punkte vergibt, lenkt seine eigenen Folgefragen – und der Kandidat merkt es am Tonfall.
Einwilligung mit echter Alternative
Die Frage nach der Aufzeichnung nennt die Alternative im selben Satz: ein persönlich geführtes Gespräch ohne Nachteil für die Bewerbung. Ohne diese vorab erkennbare Wahl bliebe nur Aufzeichnung oder Gesprächsende – das ist keine freiwillige Einwilligung, und eine unwirksame Einwilligung trägt die gesamte Verarbeitung nicht.
Der Score wird gerechnet, nicht geschätzt
Das Sprachmodell liefert sechs Ganzzahlen von 0 bis 5, die Arithmetik macht JavaScript in n8n: fachliche Eignung und Praxisnachweis je 25 %, Motivation und Kommunikation je 15 %, Rahmenbedingungen und Eigeninitiative je 10 %. Damit ist die häufigste Fehlerquelle ausgeschlossen – dass sich ein Modell sein Ergebnis zurechtrechnet.
Zitatpflicht je Dimension
Jede Teilnote muss einen wörtlichen Transkript-Ausschnitt als Beleg mitführen; das Schema erzwingt das Feld. Ein erfundenes Zitat ist gegen das mitgelieferte Transkript prüfbar – damit ist der Anreiz zum Erfinden strukturell entwertet, statt nur verboten zu sein.
Fehlende Information heißt „nicht erfragt"
Wo nichts im Transkript steht, steht im Protokoll wörtlich „nicht erfragt" und die Dimension landet in einer Liste der Datenlücken. Es gibt keinen Pfad, auf dem eine Vermutung als Fakt durchrutscht: Das System darf sagen, dass es etwas nicht weiß – raten darf es nicht.
Kein vollautomatisches Nein
Das System empfiehlt, der Mensch entscheidet. Bei fehlender Einwilligung, Abbruch oder einem Gespräch unter 120 Sekunden wird die Empfehlung erzwungen auf „unklar, nachfassen" gesetzt. Der Rückkanal hinter den Slack-Buttons ist bewusst nicht gebaut: Eine versehentlich verschickte Absage lässt sich nicht zurückholen.
Was nicht bewertet werden darf
Weder der Agent noch die Auswertung berücksichtigen Alter, Geschlecht, Herkunft, Akzent oder Sprechtempo. „Kommunikationsfähigkeit" misst ausschließlich Struktur und Nachvollziehbarkeit der Inhalte – sonst wäre die Dimension eine Bewertung der Muttersprache.
Zwei Prüfschichten vor dem ersten Node
Am Webhook vergleicht eine Header-Auth-Credential den Wert des gemeinsamen Geheimnisses, bevor überhaupt etwas startet; der erste Code-Node prüft zusätzlich, ob der Header ankommt. Danach folgen Nachrichtentyp und Idempotenz über die Anruf-ID, damit ein wiederholt zugestellter Bericht kein zweites Protokoll erzeugt.
Wartezeit als Entwurfsentscheidung
Der Großteil der gefühlten Verzögerung entsteht im Endpointing und beim ersten Token, nicht im Netz. Wer das Modell tauscht, gewinnt etwa 300 ms; wer das Endpointing richtig einstellt, bis zu 1500 ms. Die Konfiguration hält bewusst einen Boden von 700 ms statt der voreingestellten 200 ms – ein Agent, der sofort nach dem letzten Wort losredet, wirkt nicht schnell, sondern unhöflich.
Kosten vor dem Bau durchgerechnet
Rund 1,60 US-Dollar je zehnminütigem Gespräch, aufgeschlüsselt nach Telefonie, Spracherkennung, Modell, Sprachsynthese und Plattformgebühr, mit drei benannten Stellschrauben. Der Posten, den fast jede Kalkulation übersieht: Die Spracherkennung wird für zwei Audiokanäle abgerechnet – zehn Gesprächsminuten sind zwanzig abgerechnete Minuten.
Vorführbar ohne Telefon
Eine passwortgeschützte Next.js-Oberfläche bündelt Foliensatz, Dokumentation und die vier Workflows als bedienbaren Knotengraph – und erlaubt es, den Agenten über das Vapi-Web-SDK direkt im Browser anzurufen. Die Anmeldung läuft ohne Datenbank und ohne Auth-Paket über ein signiertes HttpOnly-Cookie.
Technik
Eingesetzter Stack
Sprachschicht
Orchestrierung
Auswertung & Ausgabe
Vorführumgebung
Weitere Projekte
Ähnliches Vorhaben? Schreib mir.
Ob SaaS-Plattform, KI-Integration oder ein internes Werkzeug, das jemandem den Tag zurückgibt – ich bringe Ideen schnell und professionell zum Laufen.