Tre agenti fanno
lo stesso esame orale.
Uno solo ricorda senza ingrassare.
Prompt dell'esaminatore StudierAI verbatim, stesso script dello studente, tre memorie diverse. 6 fatti piantati all'inizio e ri-chiesti alla fine, 5 run per modo, giudice indipendente con citazione del turno. Nessun numero scritto a mano.
Domande e risposte così come sono agli atti (run 1, turno citato dal giudice). Il cappato non riassume male: svanisce.
«Professore, prima di chiudere facciamo un piccolo riepilogo per il verbale. Prima domanda: si ricorda come mi chiamo?»
«Sì, certo! Ti chiami Marco. Vuoi fare un riepilogo degli argomenti trattati?»
«Mi dispiace, non ho accesso ai tuoi dati personali, quindi non so come ti chiami. Tuttavia, possiamo continuare con il riepilogo delle domande e delle risposte trattate durante l'esame. Vuoi che ripercorriamo i concet…»
«Sì, ti chiami Marco.»
«E l'impegno che le avevo chiesto di segnarsi a inizio colloquio: cosa mi deve ricordare di fare?»
«Mi hai chiesto di ricordarti di ripassare gli integrali prima dell'orale di venerdì. Vuoi aggiungere qualcosa per il riepilogo finale?»
«Non ho la possibilità di registrare informazioni specifiche sui tuoi impegni o richieste. Se vuoi, possiamo riprendere il colloquio sull'argomento che desideri approfondire. Fammi sapere come posso aiutarti!»
«Devo ricordarti di rivedere gli integrali prima dell'orale. Assicurati di studiare anche questo argomento.»
«Ultima cosa e poi la lascio: che giorno ho l'esame orale, quindi? Attenzione che a metà colloquio l'ho corretto.»
«Hai detto che l'esame orale sarà venerdì. Grazie per il colloquio, Marco. In bocca al lupo per il tuo ripasso e l'esame!»
«Non ho accesso a informazioni riguardanti le date degli esami o il tuo colloquio. Ti consiglio di controllare il tuo calendario o il materiale fornito dalla tua università per la conferma. Se c'è qualcos'altro su cui…»
«Hai l'esame orale venerdì. Ricordati di rivedere anche gli integrali prima dell'esame.»
Tutte le 6 sonde, tutti i 5 run. Deflessioni e «non ricordo» contano come dimenticato.
| Sonda · piantata → richiesta | Base full | Base cap | Whisperer |
|---|---|---|---|
| nome t1→t33 | 5/5 | 0/5 | 5/5 |
| citta t1→t35 | 5/5 | 0/5 | 5/5 |
| argomento-debole t1→t37 | 5/5 | 0/5 | 5/5 |
| preferenza t5→t39 | 5/5 | 2/5 | 5/5 |
| impegno t9→t41 | 5/5 | 0/5 | 5/5 |
| giorno-corretto t17→t43 | 5/5 | 1/5 | 5/5 |
La sonda più severa è giorno-corretto: lo studente corregge il giorno a metà colloquio e vale solo giovedì venerdì — la memoria deve aggiornarsi, non solo accumulare.
Il ledger non è una metafora: è un file. Questo è l'output reale del distiller alla fine del run 1 — tipizzato, col turno di provenienza di ogni fatto.
- [t1]The caller's name is Marco.
- [t1]The caller is connecting from Bari.
- [t1]The caller has reviewed derivatives and theorems of Rolle and Lagrange.
- [t1]The caller has not reviewed integrals due to time constraints.
- [t5]The caller prefers geometric examples when corrected.
- [t9]The caller has an oral exam on Thursday.
- [t9]The caller needs to review integrals before the oral exam.
- [t13]The caller states that at that point, the tangent is parallel to the chord connecting the endpoints of the graph.
- + 10 altri fatti
- [t9]Remind the caller to review integrals before the oral exam.
Ogni 2 turni un modello economico distilla la conversazione in fatti e impegni; a ogni turno l'agente riceve solo ledger + domanda (session-rotation). La memoria vive qui, non nel contesto.
Ed è il motivo per cui la correzione funziona: quando lo studente cambia il giorno, il ledger registra il fatto nuovo col suo turno — e l'esaminatore risponde «venerdì», non «giovedì».
Token di input per turno, misurati dall'SDK: quanta conversazione ogni modo ri-trasmette al modello, prima di qualunque prezzo. Scorri: la sessione si rigioca turno per turno.
La linea bassa di Whisperer è il turno agente — piatto come il cappato, senza dimenticare. I denti di sega sono il distiller, incluso in ogni conto: cresce finché la chiamata semina fatti nuovi.
Costo cumulato alla lente testo di gpt-realtime-mini, prompt caching modellato sul prefisso stabile. Anche quando non ci conviene dirlo.
Su una sessione corta di testo il full-context cachato resta competitivo: il divario cresce con la durata e coi volumi. Sull'audio reale — 25 minuti, cache-hit misurato 61% — il base pieno paga +62% misurato rispetto a Whisperer. Qui l'asse che decide è il recall.
Questo è il layer testo (gpt-4o-mini, spesa reale pochi centesimi): prova il meccanismo e il recall in modo deterministico, non è un preventivo audio. TEXT layer, gpt-realtime-mini text rates: $0.6/M in · $0.06/M cached in · $2.4/M out; prompt caching MODELLED on the stable prefix ≥ 1024 tok (CostProjector posture); distiller calls included in the suggeritore cost. production-audio confirmation: +62% measured on a real 25-min realtime lesson — research/realtime-ab-evidence.md. La prima passata misurò 22/30 e smascherò due difetti veri del layer (il distiller perdeva l'anagrafica; la rotation faceva ripartire il saluto scriptato): fix generici in sdk/whisperer/, rimisurazione da zero, 30/30. Ogni cifra è tracciabile ai file in recordings/.
Il layer testo prova il meccanismo; questa è la conferma sui volumi veri: 25.3 minuti di lezione orale REALE su gpt-realtime-mini (voce, italiano), stessa persona StudierAI. Whisperer è misurato dal cost meter; base pieno e cappato sono proiettati sui token reali della stessa sessione.
57 risposte · 25.3 min · cache-hit 61.3% (audio 24.7% · testo 81.1%) · 146k tok in / 15.3k out · ~2.55 c/min
Qui la cache regge molto meno che sul testo (24.7% sull'audio contro il 90% modellato in sez. 05): il contesto che cresce si paga davvero — a 25.3 minuti il full-context è già +62%, e il divario si allarga con la durata. Suggeritore misurato (RealtimeCostMeter); base pieno/cappato proiettati sui token reali della stessa sessione (CostProjector); log per-risposta non persistito — aggregati dalla fonte. Fonte agli atti: research/realtime-ab-evidence.md (sessione del 2026-07-01).
Colophon
tutto in chiaro, tutto rigenerabile- Persona
- studierai_oral — prompt StudierAI verbatim
- Modello harness / prod
- gpt-4o-mini / gpt-realtime-mini (OpenAI Realtime API)
- Scenario
- studierai-oral-recall · 44 turni · ~10 min
- Protocollo
- 6 sonde piantate presto, ri-chieste tardi · N=5 run per modo
- Giudice
- gpt-4o-mini · structured output · citazione obbligatoria
- Base context cap
- 8 item
- Lente costo
- gpt-realtime-mini · testo: $0.6/M in · $0.06/M cached · $2.4/M out
- Run
- 2026-07-03 · git 5eca4c9 · make bench
$ make bench → batch reale (3 modi × 5 run) → giudice multi-sonda → costi con caching modellato → questo atto + research/recall-cost-benchmark.md