Alle Projekte
Sprachagent · KI-Automatisierung2026REFERENZPROJEKT

HR Voice Agent

Führt das telefonische Erstgespräch, wertet es belegt aus und legt dem HR-Team ein entscheidungsreifes Protokoll in Slack ab.

70
Nodes in 4 Workflows
6
Bewertungsdimensionen
≈ 2 s
Antwortzeit im Gespräch
1:7
Kosten gegenüber Mensch

Meine Rolle

Testprojekt, vollständig ausgearbeitet und in Eigenregie umgesetzt: Konzept, Architektur, Gesprächs-Prompt, Bewertungslogik, die vier n8n-Workflows, der rechtliche Rahmen, die Dokumentation und die Vorführumgebung.

Art

Eigenentwicklung – Konzept, Umsetzung und Betrieb in Eigenregie.

Hinweis: Entstanden als vollständig ausgearbeitete Testaufgabe. Das Unternehmen, für das sie erstellt wurde, wird hier bewusst nicht genannt; Rufnummern, Kanalnamen und Zugangsdaten sind ausgelassen. Alle genannten Zahlen stammen aus abgelegten Prüfläufen gegen die echten Dienste.

Ausgangslage

Das Problem

Ein telefonisches Erstgespräch kostet im Recruiting immer dieselbe halbe Stunde – Termin finden, führen, Notizen tippen, weitergeben. Es automatisieren zu wollen ist der leichte Teil; der schwere ist, dass am Ende eine Personalentscheidung vorbereitet wird. Damit gelten Regeln, die für eine Pizzabestellung nicht gelten: Ein Sprachmodell, das Punktzahlen vergibt, darf nichts erfinden, es darf nicht nach Alter, Herkunft oder Akzent urteilen, und es darf niemanden vollautomatisch ablehnen. Dazu kommt die Aufzeichnung: Ohne freiwillige Einwilligung trägt die Verarbeitung nicht – und freiwillig ist eine Einwilligung nur, wenn es eine echte Alternative gibt.

Lösung

Der Ansatz

Die Aufgabenteilung ist bewusst scharf gezogen: Vapi macht Telefonie, Spracherkennung, die Echtzeit-Schleife und die Sprachsynthese; n8n orchestriert alles danach. Der Agent führt sechs Gesprächsphasen in 8 bis 12 Minuten – Werdegang, fachliche Tiefe, Motivation, Rahmenbedingungen, Rückfragen, Abschluss – und bewertet dabei nie. Er hört zu. Erst nach dem Auflegen läuft die Auswertung in drei getrennten Stufen: Extraktion („Was wurde gesagt?"), Bewertung („Wie gut ist das?") und Entscheidung („Was folgt daraus?"). Die ersten beiden Stufen macht ein Sprachmodell mit striktem JSON-Schema, die dritte rechnet JavaScript in n8n – der gewichtete Gesamtscore entsteht nie im Modell. Das Ergebnis geht als Block-Kit-Protokoll in den HR-Kanal, aus dem sich in etwa 15 Sekunden eine Entscheidung ableiten lässt.

Ergebnis

Was dabei herauskam

Vier importierbare n8n-Workflows mit zusammen 70 Nodes, ein durchkonfigurierter Assistent, ein Slack-Protokoll und sieben ausformulierte Fachantworten zu Bewertungslogik, Vapi-Einstellungen, Voice-Modellen, Latenz, eigener Transkript-Pipeline, EU-Datenschutz und AWS-Betrieb. Die Kette ist gegen die echten Dienste durchgelaufen und die Ausgabe abgelegt: Bewertung mit striktem Schema, deterministischer Score von 87 %, Slack nimmt die Struktur an. Dazu eine passwortgeschützte Next.js-Oberfläche, in der sich der Agent ohne Telefon direkt im Browser anrufen lässt und die Workflows im Original-Look zu sehen sind. Was fehlt, steht ebenso ausdrücklich in der Dokumentation wie das, was da ist – dreizehn bewusst nicht gebaute Punkte, jeder mit Begründung.

Funktionen

Was drin steckt

01

Der Agent urteilt nicht im Gespräch

Sechs Phasen, feste Reihenfolge, gleiche Fragen für alle. Bewertet wird ausschließlich danach, aus dem Transkript. Ein Modell, das schon währenddessen Punkte vergibt, lenkt seine eigenen Folgefragen – und der Kandidat merkt es am Tonfall.

02

Einwilligung mit echter Alternative

Die Frage nach der Aufzeichnung nennt die Alternative im selben Satz: ein persönlich geführtes Gespräch ohne Nachteil für die Bewerbung. Ohne diese vorab erkennbare Wahl bliebe nur Aufzeichnung oder Gesprächsende – das ist keine freiwillige Einwilligung, und eine unwirksame Einwilligung trägt die gesamte Verarbeitung nicht.

03

Der Score wird gerechnet, nicht geschätzt

Das Sprachmodell liefert sechs Ganzzahlen von 0 bis 5, die Arithmetik macht JavaScript in n8n: fachliche Eignung und Praxisnachweis je 25 %, Motivation und Kommunikation je 15 %, Rahmenbedingungen und Eigeninitiative je 10 %. Damit ist die häufigste Fehlerquelle ausgeschlossen – dass sich ein Modell sein Ergebnis zurechtrechnet.

04

Zitatpflicht je Dimension

Jede Teilnote muss einen wörtlichen Transkript-Ausschnitt als Beleg mitführen; das Schema erzwingt das Feld. Ein erfundenes Zitat ist gegen das mitgelieferte Transkript prüfbar – damit ist der Anreiz zum Erfinden strukturell entwertet, statt nur verboten zu sein.

05

Fehlende Information heißt „nicht erfragt"

Wo nichts im Transkript steht, steht im Protokoll wörtlich „nicht erfragt" und die Dimension landet in einer Liste der Datenlücken. Es gibt keinen Pfad, auf dem eine Vermutung als Fakt durchrutscht: Das System darf sagen, dass es etwas nicht weiß – raten darf es nicht.

06

Kein vollautomatisches Nein

Das System empfiehlt, der Mensch entscheidet. Bei fehlender Einwilligung, Abbruch oder einem Gespräch unter 120 Sekunden wird die Empfehlung erzwungen auf „unklar, nachfassen" gesetzt. Der Rückkanal hinter den Slack-Buttons ist bewusst nicht gebaut: Eine versehentlich verschickte Absage lässt sich nicht zurückholen.

07

Was nicht bewertet werden darf

Weder der Agent noch die Auswertung berücksichtigen Alter, Geschlecht, Herkunft, Akzent oder Sprechtempo. „Kommunikationsfähigkeit" misst ausschließlich Struktur und Nachvollziehbarkeit der Inhalte – sonst wäre die Dimension eine Bewertung der Muttersprache.

08

Zwei Prüfschichten vor dem ersten Node

Am Webhook vergleicht eine Header-Auth-Credential den Wert des gemeinsamen Geheimnisses, bevor überhaupt etwas startet; der erste Code-Node prüft zusätzlich, ob der Header ankommt. Danach folgen Nachrichtentyp und Idempotenz über die Anruf-ID, damit ein wiederholt zugestellter Bericht kein zweites Protokoll erzeugt.

09

Wartezeit als Entwurfsentscheidung

Der Großteil der gefühlten Verzögerung entsteht im Endpointing und beim ersten Token, nicht im Netz. Wer das Modell tauscht, gewinnt etwa 300 ms; wer das Endpointing richtig einstellt, bis zu 1500 ms. Die Konfiguration hält bewusst einen Boden von 700 ms statt der voreingestellten 200 ms – ein Agent, der sofort nach dem letzten Wort losredet, wirkt nicht schnell, sondern unhöflich.

10

Kosten vor dem Bau durchgerechnet

Rund 1,60 US-Dollar je zehnminütigem Gespräch, aufgeschlüsselt nach Telefonie, Spracherkennung, Modell, Sprachsynthese und Plattformgebühr, mit drei benannten Stellschrauben. Der Posten, den fast jede Kalkulation übersieht: Die Spracherkennung wird für zwei Audiokanäle abgerechnet – zehn Gesprächsminuten sind zwanzig abgerechnete Minuten.

11

Vorführbar ohne Telefon

Eine passwortgeschützte Next.js-Oberfläche bündelt Foliensatz, Dokumentation und die vier Workflows als bedienbaren Knotengraph – und erlaubt es, den Agenten über das Vapi-Web-SDK direkt im Browser anzurufen. Die Anmeldung läuft ohne Datenbank und ohne Auth-Paket über ein signiertes HttpOnly-Cookie.

Technik

Eingesetzter Stack

Sprachschicht

VapiDeepgram nova-3 (STT)ElevenLabs Flash v2.5 (TTS)gpt-4o

Orchestrierung

n8nWebhooksCode-Nodes (JavaScript)Header-AuthIdempotenz

Auswertung & Ausgabe

OpenAI Structured Outputs (strict)Slack Block KitSlack Bot API

Vorführumgebung

Next.js (App Router)ReactTypeScriptVapi Web SDKReact FlowVercel

Weitere Projekte

Ähnliches Vorhaben? Schreib mir.

Ob SaaS-Plattform, KI-Integration oder ein internes Werkzeug, das jemandem den Tag zurückgibt – ich bringe Ideen schnell und professionell zum Laufen.