Wie viele Anrufe kann ein KI-Telefonassistent gleichzeitig annehmen?

„Mehrere Anrufe parallel“ klingt eindeutig, beantwortet aber noch keine Kapazitätsfrage. Dieser Leitfaden zeigt, wie Unternehmen die benötigte Zahl aus echten Spitzenzeiten ableiten und versteckte Engpässe erkennen.

KI-Telefonassistent bearbeitet mehrere Anrufe gleichzeitig

Kurzantwort: Ja, ein KI-Telefonassistent kann mehrere Anrufe gleichzeitig annehmen. Die konkrete Zahl ist jedoch kein allgemeines Merkmal von „KI“, sondern ein Kapazitätslimit des gebuchten Dienstes und der gesamten Telefoniekette. Für die Planung zählen nicht die Anrufe pro Tag, sondern zeitliche Überschneidungen in der stärksten Viertelstunde oder Stunde.

Ein menschlicher Empfang kann normalerweise nur ein Gespräch zur selben Zeit führen. Telefon-KI arbeitet anders: Jeder eingehende Anruf startet eine eigene Gesprächssitzung. Drei Anrufende können deshalb gleichzeitig drei unterschiedliche Anliegen schildern, ohne sich gegenseitig zu hören oder in derselben Warteschlange zu landen – sofern mindestens drei parallele Sitzungen und alle vorgeschalteten Telefoniekanäle verfügbar sind.

Die entscheidende Einkaufsfrage lautet daher nicht „Kann die KI parallel telefonieren?“, sondern: Wie viele gleichzeitig eintreffende Anrufe verarbeitet die vollständige Lösung unter unseren realen Spitzenbedingungen zuverlässig?

Vier Kennzahlen, die nicht verwechselt werden dürfen

KennzahlWas sie aussagtWas sie nicht aussagt
Anrufe pro Taggesamte Zahl der Anrufversuche eines Tageswie viele im selben Moment eintreffen
Gesprächsminutengesamte Nutzungsdauer im Abrechnungszeitraumwie viele Sitzungen parallel möglich sind
Rufnummernwie viele Nummern oder Standorte angebunden sindKapazität je Nummer oder Mandant
Parallele Anrufemaximal gleichzeitig aktive GesprächssitzungenMonatsvolumen oder garantierte Verfügbarkeit

Ein Betrieb mit nur 40 Anrufen am Tag kann mehr Parallelität benötigen als ein Unternehmen mit 120 gleichmäßig verteilten Anrufen. Wenn zehn Personen direkt nach einer Terminfreigabe anrufen, entsteht eine Spitze. Der Tagesdurchschnitt verdeckt sie vollständig.

So wird die benötigte Parallelität belastbar ermittelt

Methode A: Überschneidungen aus echten Anrufdaten zählen

Die beste Grundlage sind Start- und Endzeit jedes Gesprächs aus Telefonanlage oder Einzelverbindungsnachweis. Für jeden Zeitpunkt wird gezählt, wie viele Gespräche gleichzeitig aktiv waren. Danach werden nicht nur der absolute Höchstwert, sondern auch typische Spitzen betrachtet.

  1. Mindestens vier repräsentative Wochen exportieren; saisonale Spitzen separat betrachten.
  2. Interne Gespräche, Fax und Testanrufe entfernen, wenn sie nicht über die KI laufen sollen.
  3. Für jedes Gespräch Start- und Endzeit ermitteln.
  4. Überlappende Gespräche pro Minute oder Sekunde zählen.
  5. Maximum sowie 95. und 99. Perzentil der Parallelität bestimmen.
  6. Gewünschten Servicegrad und Rückfallweg festlegen.
  7. Mit Sicherheitsreserve und einem realen Lasttest entscheiden.

Der absolute Höchstwert kann ein einmaliger Sonderfall sein; ein Perzentil kann wiederum kritische Ereignisse ausblenden. Deshalb ist die richtige Zahl eine Geschäftsentscheidung: Darf bei einer seltenen Spitze eine Warteschlange entstehen, oder muss beispielsweise nach einer Kampagne jeder Anruf sofort beantwortet werden?

Methode B: Schätzung ohne Verlaufsdaten

Fehlen exakte Zeitstempel, lässt sich die mittlere Verkehrslast im stärksten Intervall schätzen:

Mittlere gleichzeitige Last = Anrufe im Spitzenintervall × durchschnittliche Gesprächsdauer ÷ Länge des Intervalls

Alle Zeitangaben müssen dieselbe Einheit verwenden. Bei einem 15-Minuten-Fenster wird die Gesprächsdauer ebenfalls in Minuten eingesetzt.

Diese Größe wird in der Telefonverkehrslehre in Erlang ausgedrückt. Die offizielle ITU-T-Empfehlung E.600 definiert Verkehrsintensität als Produkt aus Ankunftsrate und mittlerer Belegungsdauer; ein Erlang entspricht der durchschnittlichen Belegung einer Ressource. Die Formel liefert also die mittlere gleichzeitige Last – noch nicht die sichere Zahl benötigter Kanäle.

Rechenbeispiel: 35 Anrufe in der stärksten Viertelstunde

Ein Servicebetrieb misst montags zwischen 8:00 und 8:15 Uhr:

  • 35 eingehende Anrufe,
  • durchschnittlich 4 Minuten Gesprächsdauer,
  • 15 Minuten Beobachtungszeit.
35 × 4 ÷ 15 = 9,33 Erlang mittlere Verkehrslast

Das bedeutet: Während dieses Fensters sind rechnerisch durchschnittlich 9,33 Gesprächsressourcen belegt. Ein Limit von zehn parallelen Sitzungen wäre trotzdem nicht automatisch ausreichend, weil Anrufe zufällig eintreffen und zeitweise deutlich mehr als der Durchschnitt gleichzeitig aktiv sein können.

Für die endgültige Dimensionierung braucht das Unternehmen daher ein Serviceziel:

  • Sofortannahme: Welcher Anteil soll ohne Warten starten?
  • Blockierung: Welcher Anteil darf höchstens ein Besetztzeichen oder eine Alternativroute erhalten?
  • Warteschlange: Wie lange darf eine Person maximal warten?
  • Sonderereignis: Welche Kampagne, Störung oder Wetterlage erzeugt stärkere Spitzen als der Normalbetrieb?

Für eine mathematisch exakte Kanalplanung werden je nach gewünschtem Verhalten Verkehrsmodelle wie Erlang B ohne Warteschlange oder Erlang C mit Wartemöglichkeit verwendet. Für kleine und mittlere Unternehmen ist meist ein praktischerer Weg sinnvoll: historische Überschneidungen messen, Spitzenreserve festlegen und das Ergebnis mit einem Lasttest validieren.

Keine Scheingenauigkeit: „Tagesanrufe geteilt durch Öffnungsstunden“ ist keine Kapazitätsplanung. Verwenden Sie mindestens das stärkste 15-Minuten-Fenster. Bei sehr kurzen Kampagnenspitzen oder Störungsmeldungen können sogar Fünf-Minuten-Fenster erforderlich sein.

Sieben Stellen, an denen Parallelität begrenzt sein kann

Die nutzbare Kapazität entspricht immer dem kleinsten Limit in der gesamten Kette:

Geschäftsnummer → Provider → Telefonanlage oder SIP-Trunk → KI-Plattform → Sprach- und KI-Dienste → Integration → Übergabeziel
EngpassTypische FrageMögliche Folge
Telefonanschluss oder SIP-TrunkWie viele Sprachkanäle sind freigeschaltet?Anruf erreicht die KI gar nicht
RufumleitungKann der Anschluss mehrere Weiterleitungen gleichzeitig aufbauen?Besetztzeichen trotz freier KI-Sitzung
KI-TarifGilt das Limit pro Konto, Assistent oder Rufnummer?unerwartet geteilte Kapazität
Sprach- und ModelldiensteExistieren Rate-Limits oder Fair-Use-Grenzen?Verzögerung oder Ablehnung bei Last
Kalender, CRM oder APIWie viele gleichzeitige Lese- und Schreibvorgänge sind erlaubt?Gespräch läuft, Aktion scheitert
Live-WeiterleitungVerbraucht eine Übergabe eine zusätzliche Sitzung oder Leitung?Kapazität sinkt während Transfers
Menschliches ZielWie viele Mitarbeitende können wirklich übernehmen?KI verbindet korrekt, aber niemand antwortet

Warum „unbegrenzte Anrufe“ keine vollständige Aussage ist

„Unbegrenzt“ kann sich auf Anrufe pro Monat, auf Rufnummern oder auf parallele Sitzungen beziehen. Selbst wenn kein festes Sitzungsmaximum beworben wird, können Fair-Use-Regeln, technische Schutzlimits oder Integrationen die praktisch nutzbare Kapazität begrenzen. Lassen Sie sich deshalb schriftlich erklären:

  • welche Größe tatsächlich unbegrenzt ist,
  • ob ein technisches Hartlimit existiert,
  • ob Inbound- und Outbound-Gespräche dieselbe Kapazität teilen,
  • ob mehrere Assistenten oder Standorte aus demselben Pool schöpfen,
  • wie Transfers und wartende Gespräche gezählt werden,
  • welches Verhalten am Limit eintritt.

Was passiert, wenn alle parallelen Sitzungen belegt sind?

Ein gutes System hat für Überlast nicht nur eine Fehlermeldung, sondern eine vereinbarte Betriebsregel. Die ITU unterscheidet grundsätzlich zwischen einem blockierenden Betrieb ohne Warten und einem verzögerten Betrieb mit Wartemöglichkeit. Für Unternehmen kommen vier konkrete Varianten infrage:

ÜberlaststrategieVorteilRisiko
Besetztzeichentechnisch eindeutig und günstigAnrufende versuchen es eventuell nicht erneut
Kurze WarteschlangeSpitzen können geglättet werdenWartezeit muss angekündigt und gemessen werden
Überlauf zu Team oder Dienstleisterpersönliche Annahme bleibt möglichmenschliches Ziel kann ebenfalls ausgelastet sein
Rückrufaufnahme oder alternative NummerAnliegen geht nicht vollständig verlorenMedienbruch und spätere Nacharbeit

Die schlechteste Variante ist ein ungetesteter Standardfall, den niemand kennt. Der Anbieter sollte klar benennen können, welche Ansage Anrufende hören, welche Daten protokolliert werden und wie das Team von der Überlast erfährt.

Zwölf Fragen, die jede Kapazitätsangabe belastbar machen

  1. Wie viele aktive Inbound-Gespräche sind gleichzeitig enthalten?
  2. Gilt das Limit pro Unternehmen, Rufnummer, Assistent oder Standort?
  3. Teilen sich eingehende und ausgehende Gespräche denselben Pool?
  4. Zählen klingelnde, wartende und weitergeleitete Anrufe mit?
  5. Verbraucht eine warme Übergabe zeitweise zwei Sprachkanäle?
  6. Welches harte technische Maximum liegt über dem gebuchten Limit?
  7. Was hört der nächste Anrufer, wenn alle Sitzungen belegt sind?
  8. Kann automatisch auf ein alternatives Ziel übergelaufen werden?
  9. Werden abgewiesene und wartende Anrufversuche im Dashboard sichtbar?
  10. Welche Kapazität muss der bestehende Telefonanschluss bereitstellen?
  11. Welche Rate-Limits gelten für Kalender, CRM, Webhooks und Benachrichtigungen?
  12. Kann die Last vor dem Go-live mit unserem Spitzenprofil getestet werden?

Lasttest: Nicht nur gleichzeitig anrufen, sondern Ergebnisse prüfen

Ein Lasttest ist bestanden, wenn nicht nur alle Gespräche starten, sondern jedes Gespräch isoliert bleibt und den korrekten Prozessabschluss erzeugt. Nutzen Sie dazu ein reproduzierbares Szenario:

  1. Teststufen: nacheinander 50, 100 und 125 Prozent der geplanten Spitzenkapazität auslösen.
  2. Variierende Dauer: kurze FAQ, mittlere Datenerfassung und längere Übergabe mischen.
  3. Gleichzeitige Aktionen: mehrere Kalenderabfragen, Buchungen oder CRM-Einträge erzeugen.
  4. Grenze überschreiten: bewusst einen Anruf mehr als das Limit starten und Überlastverhalten dokumentieren.
  5. Ergebnisse abgleichen: angenommene, blockierte, weitergeleitete und abgeschlossene Anrufe zwischen Provider und Dashboard vergleichen.
PrüfwertBestanden, wenn …
Annahmealle Sitzungen bis zum vereinbarten Limit starten
Trennungkein Gespräch Wissen oder Daten eines anderen übernimmt
ReaktionszeitAntwortzeiten unter Last im vereinbarten Bereich bleiben
Aktionenkeine Doppelbuchungen oder verlorenen Datensätze entstehen
Überlastder zusätzliche Anruf die definierte Alternativroute erhält
ProtokollProvider- und Plattformzahlen nachvollziehbar übereinstimmen
ErholungKapazität nach Gesprächsende sofort wieder verfügbar ist

Weitere Grenz- und Gesprächsfälle enthält der Teloro-Testkatalog mit 30 realistischen Szenarien.

Wie viele parallele Anrufe bietet Teloro?

Teloro weist die Kapazität transparent pro Paket aus: Auf der aktuellen Preisseite sind zum Stand dieses Beitrags drei gleichzeitige Anrufe im Basis-Paket, fünf im erweiterten Paket und eine individuelle Anruflast im individuellen Paket genannt.

Welche Stufe passt, sollte nicht allein anhand der Tagesanrufe entschieden werden. Für ein Unternehmen mit bis zu 20 gleichmäßig verteilten Anrufen können drei Sitzungen ausreichen; eine Praxis mit Terminfreigabe um 8 Uhr kann bei gleichem Tagesvolumen eine andere Spitzenkapazität benötigen. In einer Teloro-Demo lässt sich das reale Lastprofil deshalb gemeinsam aus Telefoniedaten ableiten.

Häufige Fragen zu parallelen KI-Anrufen

Kann ein KI-Telefonassistent mehrere Anrufe gleichzeitig annehmen?

Ja. Jeder Anruf läuft als eigene Gesprächssitzung. Die mögliche Zahl hängt vom gebuchten Limit, der Telefonie-Anbindung und den Kapazitäten der beteiligten Systeme ab.

Wie berechnet man die benötigte Parallelität?

Am besten werden zeitlich überlappende Gespräche aus echten Start- und Endzeiten gezählt. Ohne Verlaufsdaten dient die Formel „Anrufe im Spitzenintervall × Durchschnittsdauer ÷ Intervalllänge“ als erste Schätzung der mittleren Last.

Sind Anrufe pro Tag und parallele Anrufe dasselbe?

Nein. Die Tageszahl beschreibt das Gesamtvolumen. Parallelität bezeichnet Gespräche, die im selben Moment aktiv sind. Wenige konzentrierte Anrufe können mehr Kapazität benötigen als viele gleichmäßig verteilte.

Was passiert, wenn das Limit erreicht ist?

Je nach Konfiguration hört der nächste Anrufer ein Besetztzeichen, wartet oder wird an ein alternatives Ziel weitergeleitet. Dieses Verhalten sollte ausdrücklich vereinbart und im Lasttest provoziert werden.

Bedeutet „unbegrenzt parallel“ wirklich unbegrenzt?

Nicht zwingend. Fair-Use-Regeln, Telefoniekanäle, API-Limits, Integrationen oder gemeinsame Kapazitätspools können die praktisch nutzbare Zahl begrenzen.

Wie viele parallele Anrufe unterstützt Teloro?

Aktuell sind drei gleichzeitige Anrufe im Basis-Paket, fünf im erweiterten Paket und eine individuelle Kapazität im individuellen Paket ausgewiesen. Maßgeblich bleibt die jeweils aktuelle Leistungsbeschreibung.

Fazit: Spitzenlast schlägt Tagesdurchschnitt

Telefon-KI kann Anrufe parallel bearbeiten, aber die richtige Zahl lässt sich nicht aus einer Werbeaussage oder dem Tagesvolumen ableiten. Entscheidend sind zeitliche Überschneidung, Gesprächsdauer, gewünschter Servicegrad und das kleinste Limit in der Telefoniekette.

Wer Start- und Endzeiten auswertet, die mittlere Spitzenlast berechnet, Überlastverhalten festlegt und einen reproduzierbaren Lasttest durchführt, erhält eine belastbare Kapazitätsentscheidung – statt eines zu kleinen Tarifs oder unnötig großer Reserve.

Bringen Sie Ihre Anrufzahlen und die stärkste Viertelstunde in eine Teloro-Demo mit. Wir leiten daraus die benötigte Parallelität und ein realistisches Lasttestszenario ab.

Kapazität gemeinsam berechnen

Über diesen Beitrag

Dieser Beitrag wurde vom Teloro-Redaktionsteam als nachvollziehbare Planungshilfe erstellt. Begriffe und Grundformel der Telefonverkehrslehre orientieren sich an der ITU-T-Empfehlung E.600. Die Beispielrechnung beschreibt mittlere Last und ersetzt keine individuelle Netzplanung oder Kapazitätsgarantie. Teloro-Paketangaben wurden am 26. Juli 2026 mit der veröffentlichten Preisseite abgeglichen.