Otestujte agenta end-to-end (API)
Spouštějte jednorázové simulace, paralelní dávky scénářů a sady kontrol před vydáním prostřednictvím API ThunderPhone, aby se regrese agenta zachytily dříve, než je uslyší zákazníci.
Iterace AI agenta znamená upravovat jeho prompt, jeho nástroje a způsob, jakým zpracovává okrajové případy. API simulací provádí skutečné hovory s agentem pomocí vámi zadaného promptu scénáře. Cílení na agenta vytvoří běh bot-bot; cílení na telefonní číslo vytvoří běh se smyčkou SIP. Každý běh vytvoří skutečný protokol hovoru s přepisem, hodnocením a účtováním, takže přesně uvidíte, jak se agent chová a kolik stojí.
Použijte ho pro:
- Rychlé testy před nasazením po každé úpravě promptu
- Regresní sady propojené s CI (připojte webhook
test-call.completed→ selže sestavení, pokud skóre klesne) - Zátěžové testování limitů souběžnosti
Jednorázově: jeden běh
curl -X POST https://api.thunderphone.com/v1/simulations \
-H "Authorization: Bearer sk_live_YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"target_type": "agent",
"target_id": 12,
"direction": "outbound",
"scenario_prompt": "You are a polite caller asking about refund policy for order 12345.",
"consent_to_charge": true
}'Pole:
| Pole | Typ | Povinné | Popis |
|---|---|---|---|
target_type | řetězec | ano | agent nebo phone_number |
target_id | celé číslo | ano | ID agenta (nebo ID telefonního čísla) |
direction | řetězec | ne | outbound (výchozí; testovací volající zahajuje hovor) nebo inbound (testovací volající hovor přijímá) |
scenario_prompt | řetězec | ne | Určuje, co testovací bot říká |
language / primary_language | řetězec | ne | Jazyk testovacího volajícího; nepodporované kódy jsou odmítnuty |
simulator_product | řetězec | ne | testing (výchozí) nebo spark pro simulovaného volajícího, který působí lidštěji, například pro testy konzultace při teplém přepojení |
consent_to_charge | boolean | ano | Musí být true. Odhad účtuje vybraného agenta i simulovaného volajícího a případně také telekomunikační větev |
target_number | řetězec | ne | Přepsání vzdálené strany ve formátu E.164; jinak se použije testovací číslo platformy |
mode je určen pouze ke čtení a odvozuje se z target_type: agent vytvoří
mode="bot", zatímco phone_number vytvoří mode="sip".
Odpovědí je objekt běhu simulace
se stavem status="queued". Dotazujte se, dokud se status nezmění na completed nebo
failed; po nastavení call_id načtěte přepis pomocí
GET /v1/calls/{call_id}/transcript.
Dávky: paralelní scénáře
Spusťte souběžně N scénářů — užitečné pro regresní sady, které paralelně pokrývají každý známý okrajový případ:
curl -X POST https://api.thunderphone.com/v1/simulations/batches \
-H "Authorization: Bearer sk_live_YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"target_type": "agent",
"target_id": 12,
"direction": "outbound",
"run_count": 5,
"stagger_seconds": 2,
"scenario_prompts": [
"Ask about refund policy.",
"Ask for hours of operation.",
"Complain about a delayed shipment.",
"Ask to speak with a human.",
"Ask an unrelated trivia question."
],
"consent_to_charge": true
}'Odpověď obsahuje seznam run_ids s ID podřízených běhů. Načtení stavu
dávky:
curl https://api.thunderphone.com/v1/simulations/batches/{batch_id} \
-H "Authorization: Bearer sk_live_YOUR_API_KEY"run_count je omezeno na 20; stagger_seconds rozloží spouštění
v čase, aby nedošlo k přetížení agenta (0–60 s).
Zapojte do CI
Na stránce Simulace
(/dashboard/simulations) vytvořte sadu bran pro vydání — vyberte agenta, přidejte scénáře ručně nebo klikněte na Generovat scénáře pomocí AI, abyste je navrhli podle promptu agenta (s volitelným průchodem okrajových případů), a seskupte je do sady. Sada připne své scénáře a agenta spolu s minimální mírou úspěšnosti a volitelným pravidlem nulového počtu kritických selhání. Úspěšné běhy se stanou přijatým základem; pozdější přechody z úspěchu na selhání se vracejí jako regrese.
V CI použijte klíč API organizace.
Tento skript spustí sadu, dotazuje se, dokud není dokončeno hodnocení a porovnání,
a skončí s nenulovým kódem, pokud verdikt není pass:
#!/usr/bin/env bash
set -euo pipefail
: "${THUNDERPHONE_API_KEY:?Set THUNDERPHONE_API_KEY}"
: "${THUNDERPHONE_ORG_ID:?Set THUNDERPHONE_ORG_ID}"
: "${THUNDERPHONE_SUITE_ID:?Set THUNDERPHONE_SUITE_ID}"
base="https://api.thunderphone.com/v1/orgs/${THUNDERPHONE_ORG_ID}/suites/${THUNDERPHONE_SUITE_ID}"
auth="Authorization: Bearer ${THUNDERPHONE_API_KEY}"
run_id="$(curl --fail --silent --show-error -X POST "${base}/run" \
-H "$auth" -H "Content-Type: application/json" -d '{}' | jq -r '.id')"
deadline=$((SECONDS + 1800))
while (( SECONDS < deadline )); do
result="$(curl --fail --silent --show-error \
"${base}/runs/${run_id}" -H "$auth")"
status="$(jq -r '.status' <<<"$result")"
if [[ "$status" == "completed" ]]; then
jq . <<<"$result"
[[ "$(jq -r '.verdict' <<<"$result")" == "pass" ]]
exit
fi
sleep 10
done
echo "ThunderPhone suite timed out" >&2
exit 1POST /v1/orgs/{org_id}/suites/{suite_id}/run vrací 202 s ID
běhu. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} vrací
status, verdict, pass_rate, critical_failure_count a seznam
regresí základu regressions. Oba endpointy vážou organizaci v URL
k organizaci klíče API.
Vzory
Korpus regresí pro jednotlivé prompty
Udržujte soubor JSON s n-ticemi {name, scenario_prompt, expected_outcome}.
Při každé změně promptu spusťte celou sadu jako dávku; porovnejte přepisy
a hodnocení s předchozím během.
Test kouře pro jednotlivá vydání
Jedna dávka pěti scénářů úspěšného průchodu, kterou spustíte po každém
nasazení. Je citlivá na latenci, proto ponechte stagger_seconds: 0.
Benchmarking latence
Spouštějte identické scénáře proti různým produktovým úrovním (spark,
bolt, storm-base). Porovnejte skóre call.graded a
duration_seconds z každého výsledného protokolu hovoru.
Další kroky
Všechny parametry dotazů, stavové kódy a struktury dávek.
Automaticky ohodnoťte každý testovací běh a sledujte kvalitu v čase.
Označte konkrétní testy pro lidskou kontrolu.
Odesílejte výsledky do CI / Slack / PagerDuty.