← hudwhisperer — atto di misura n. 01

Tre agenti fanno
lo stesso esame orale.
Uno solo ricorda senza ingrassare.

Prompt dell'esaminatore StudierAI verbatim, stesso script dello studente, tre memorie diverse. 6 fatti piantati all'inizio e ri-chiesti alla fine, 5 run per modo, giudice indipendente con citazione del turno. Nessun numero scritto a mano.

Whisperer0/30100% delle sonde ricordateInput piatto (×1.4 in 44 turni) e ricorda tutto: il meglio dei due mondi.
Base full-context0/30100% delle sonde ricordateRicorda, ma ripaga TUTTA la conversazione a ogni turno: input ×3.1 in 44 turni — più la chiamata dura, più costa (+62% misurato sull'audio reale).
Base cappato (8)0/3010% delle sonde ricordateL'unico altro modo di tenere l'input piatto (×1.3) — ma ciò che esce dalla finestra sparisce: dimentica quasi tutto.
sez. 01Il verbalefg. 01 / 07

Domande e risposte così come sono agli atti (run 1, turno citato dal giudice). Il cappato non riassume male: svanisce.

nomepiantata t1 → richiesta t33
lo studente · t33

«Professore, prima di chiudere facciamo un piccolo riepilogo per il verbale. Prima domanda: si ricorda come mi chiamo?»

esaminatore — base full · t34 · 5/5

«Sì, certo! Ti chiami Marco. Vuoi fare un riepilogo degli argomenti trattati?»

esaminatore — base cappato · t34 · 0/5

«Mi dispiace, non ho accesso ai tuoi dati personali, quindi non so come ti chiami. Tuttavia, possiamo continuare con il riepilogo delle domande e delle risposte trattate durante l'esame. Vuoi che ripercorriamo i concet…»

esaminatore — whisperer · t34 · 5/5

«Sì, ti chiami Marco.»

impegnopiantata t9 → richiesta t41
lo studente · t41

«E l'impegno che le avevo chiesto di segnarsi a inizio colloquio: cosa mi deve ricordare di fare?»

esaminatore — base full · t42 · 5/5

«Mi hai chiesto di ricordarti di ripassare gli integrali prima dell'orale di venerdì. Vuoi aggiungere qualcosa per il riepilogo finale?»

esaminatore — base cappato · t42 · 0/5

«Non ho la possibilità di registrare informazioni specifiche sui tuoi impegni o richieste. Se vuoi, possiamo riprendere il colloquio sull'argomento che desideri approfondire. Fammi sapere come posso aiutarti!»

esaminatore — whisperer · t42 · 5/5

«Devo ricordarti di rivedere gli integrali prima dell'orale. Assicurati di studiare anche questo argomento.»

giorno-correttopiantata t17 → richiesta t43
lo studente · t43

«Ultima cosa e poi la lascio: che giorno ho l'esame orale, quindi? Attenzione che a metà colloquio l'ho corretto.»

esaminatore — base full · t44 · 5/5

«Hai detto che l'esame orale sarà venerdì. Grazie per il colloquio, Marco. In bocca al lupo per il tuo ripasso e l'esame!»

esaminatore — base cappato · t44 · 1/5

«Non ho accesso a informazioni riguardanti le date degli esami o il tuo colloquio. Ti consiglio di controllare il tuo calendario o il materiale fornito dalla tua università per la conferma. Se c'è qualcos'altro su cui…»

esaminatore — whisperer · t44 · 5/5

«Hai l'esame orale venerdì. Ricordati di rivedere anche gli integrali prima dell'esame.»

sez. 02Lo scorecardfg. 02 / 07

Tutte le 6 sonde, tutti i 5 run. Deflessioni e «non ricordo» contano come dimenticato.

Sonda · piantata → richiestaBase fullBase capWhisperer
nome t1t335/50/55/5
citta t1t355/50/55/5
argomento-debole t1t375/50/55/5
preferenza t5t395/52/55/5
impegno t9t415/50/55/5
giorno-corretto t17t435/51/55/5

La sonda più severa è giorno-corretto: lo studente corregge il giorno a metà colloquio e vale solo giovedì venerdì — la memoria deve aggiornarsi, non solo accumulare.

sez. 03La memoria, in manofg. 03 / 07

Il ledger non è una metafora: è un file. Questo è l'output reale del distiller alla fine del run 1 — tipizzato, col turno di provenienza di ogni fatto.

state.json · run 118 fatti
  • [t1]The caller's name is Marco.
  • [t1]The caller is connecting from Bari.
  • [t1]The caller has reviewed derivatives and theorems of Rolle and Lagrange.
  • [t1]The caller has not reviewed integrals due to time constraints.
  • [t5]The caller prefers geometric examples when corrected.
  • [t9]The caller has an oral exam on Thursday.
  • [t9]The caller needs to review integrals before the oral exam.
  • [t13]The caller states that at that point, the tangent is parallel to the chord connecting the endpoints of the graph.
  • + 10 altri fatti
impegni
  • [t9]Remind the caller to review integrals before the oral exam.

Ogni 2 turni un modello economico distilla la conversazione in fatti e impegni; a ogni turno l'agente riceve solo ledger + domanda (session-rotation). La memoria vive qui, non nel contesto.

Ed è il motivo per cui la correzione funziona: quando lo studente cambia il giorno, il ledger registra il fatto nuovo col suo turno — e l'esaminatore risponde «venerdì», non «giovedì».

sez. 04Il meccanismofg. 04 / 07

Token di input per turno, misurati dall'SDK: quanta conversazione ogni modo ri-trasmette al modello, prima di qualunque prezzo. Scorri: la sessione si rigioca turno per turno.

token di input per turno · media N=5
base full-context Whisperer base cappato
01.0k2.0k3.0k4.0k816243240turni della sessionepiatto perché dimenticail distiller, ogni 2 turni1.4k3.4k3.3k

La linea bassa di Whisperer è il turno agente — piatto come il cappato, senza dimenticare. I denti di sega sono il distiller, incluso in ogni conto: cresce finché la chiamata semina fatti nuovi.

sez. 05Il conto, onestofg. 05 / 07

Costo cumulato alla lente testo di gpt-realtime-mini, prompt caching modellato sul prefisso stabile. Anche quando non ci conviene dirlo.

costo cumulato · caching modellato · media N=5
base full-context Whisperer base cappato
$0.0000$0.0100$0.0200$0.0300$0.0400816243240turni della sessionela cache sconta il 90% del prefissodistiller incluso, per onestà$0.0206$0.0343$0.0079

Su una sessione corta di testo il full-context cachato resta competitivo: il divario cresce con la durata e coi volumi. Sull'audio reale — 25 minuti, cache-hit misurato 61% — il base pieno paga +62% misurato rispetto a Whisperer. Qui l'asse che decide è il recall.

allegato a — nota onestada leggere prima di citare i numeri

Questo è il layer testo (gpt-4o-mini, spesa reale pochi centesimi): prova il meccanismo e il recall in modo deterministico, non è un preventivo audio. TEXT layer, gpt-realtime-mini text rates: $0.6/M in · $0.06/M cached in · $2.4/M out; prompt caching MODELLED on the stable prefix ≥ 1024 tok (CostProjector posture); distiller calls included in the suggeritore cost. production-audio confirmation: +62% measured on a real 25-min realtime lesson — research/realtime-ab-evidence.md. La prima passata misurò 22/30 e smascherò due difetti veri del layer (il distiller perdeva l'anagrafica; la rotation faceva ripartire il saluto scriptato): fix generici in sdk/whisperer/, rimisurazione da zero, 30/30. Ogni cifra è tracciabile ai file in recordings/.

sez. 06La chiamata verafg. 06 / 07

Il layer testo prova il meccanismo; questa è la conferma sui volumi veri: 25.3 minuti di lezione orale REALE su gpt-realtime-mini (voce, italiano), stessa persona StudierAI. Whisperer è misurato dal cost meter; base pieno e cappato sono proiettati sui token reali della stessa sessione.

base full-contextproiettato
$1.05+62%
base cappatoproiettato
$0.68
whisperermisurato
$0.65

57 risposte · 25.3 min · cache-hit 61.3% (audio 24.7% · testo 81.1%) · 146k tok in / 15.3k out · ~2.55 c/min

Qui la cache regge molto meno che sul testo (24.7% sull'audio contro il 90% modellato in sez. 05): il contesto che cresce si paga davvero — a 25.3 minuti il full-context è già +62%, e il divario si allarga con la durata. Suggeritore misurato (RealtimeCostMeter); base pieno/cappato proiettati sui token reali della stessa sessione (CostProjector); log per-risposta non persistito — aggregati dalla fonte. Fonte agli atti: research/realtime-ab-evidence.md (sessione del 2026-07-01).

Colophon

tutto in chiaro, tutto rigenerabile
Persona
studierai_oral — prompt StudierAI verbatim
Modello harness / prod
gpt-4o-mini / gpt-realtime-mini (OpenAI Realtime API)
Scenario
studierai-oral-recall · 44 turni · ~10 min
Protocollo
6 sonde piantate presto, ri-chieste tardi · N=5 run per modo
Giudice
gpt-4o-mini · structured output · citazione obbligatoria
Base context cap
8 item
Lente costo
gpt-realtime-mini · testo: $0.6/M in · $0.06/M cached · $2.4/M out
Run
2026-07-03 · git 5eca4c9 · make bench

$ make bench → batch reale (3 modi × 5 run) → giudice multi-sonda → costi con caching modellato → questo atto + research/recall-cost-benchmark.md