research(vrp): f misurato sul 10g — il mio sospetto era sbagliato, e il campione non basta ancora

Book, pesi, config INVARIATI. Nuovo sorvegliante in cron_daily.

IL CAMPIONE C'ERA GIA': 8 scadenze utilizzabili per asset su 8, entrambe le
strutture, 16 osservazioni ciascuna. Non serviva aspettare per fare la misura;
serve aspettare per rispondere alla DIFFERENZA, che e' un'altra domanda.

CORREZIONE A UN ARGOMENTO PUBBLICATO POCHE ORE FA. Nel gate del tenore avevo
scritto che la cella vincente 'sta massimizzando l'errore di modello' perche'
compra l'ala piu' lontana. Misurato: il meccanismo e' confermato e piu' forte
del previsto (f_long 5.85 contro 2.23) ma la conclusione era ROVESCIATA —
quell'ala pesa il 3.2% del premio corto invece del 18.4%, quindi sul credito
NETTO l'effetto e' minore: f_net 0.852 contro 0.718, il candidato ha un f
MIGLIORE. Con f_net = (f_short - k*f_long)/(1-k), un f_long grande fa danno
solo moltiplicato per un k grande: avevo guardato il fattore e non il peso.
La decisione (nessun cambio) regge, ma su tre gambe invece di quattro.

Artefatto di tick escluso prima di crederci: l'ask dell'ala sta a 22 tick
mediani, minimo 15, 0% delle osservazioni a <=2 tick.

LA DIFFERENZA NON E' STABILITA: appaiata per (asset, scadenza) fa +0.109 con
IC95 [-0.047, +0.193], 11/16 positive -> contiene lo zero. Replica indipendente
del canonico: 0.718 per un percorso con finestra DTE e pairing diversi da
quello che stamattina dava 0.73.

CRITERIO PRE-REGISTRATO, congelato in un test: >=40 coppie E ampiezza IC95
<=0.12 (oggi 16 e 0.241), prima gamba verso fine ottobre 2026. Il sorvegliante
rifa' la misura ogni giorno e notifica una volta sola quando basta — lezione
DVOLSPREAD, un lead senza sorvegliante e senza data e' un lead perso.

Calibrazione della soglia verificata prima di fidarsene: con differenza vera
nulla lo zero e' escluso nel 5.0/4.0/3.0% dei casi a n=16/40/60, cioe' il 5%
atteso. Il test iniziale su seed fisso falliva perche' quel seed era uno dei 5%
legittimi: sostituito con un test sulla proprieta'.

REGOLE: (a) un fattore di errore si giudica moltiplicato per il suo peso;
(b) prima di credere a un rapporto estremo su un prezzo piccolo, contare i
tick; (c) una soglia sull'ampiezza di un IC richiede di verificarne la
copertura; (d) 'non abbastanza campione' non e' 'nessuna differenza'.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
Adriano Dal Pastro
2026-07-30 22:17:11 +00:00
parent 36dc55748e
commit fb01c5714c
6 changed files with 479 additions and 6 deletions
+37 -6
View File
@@ -210,12 +210,13 @@ Prima ondata di ricerca onesta su BTC/ETH certificati (5 track, harness condivis
📌 **Il buco si chiude meglio sul contenuto che sul gate: la regione MAI esplorata PERDE.**
Miglior cella >10g = 18g 0.28/0.05, **rango 8/72**, e solo **3/10** della top-10 stanno oltre i
10 giorni → lo studio **conferma** il 03/07 invece di ribaltarlo.
⚠️ **Il vincitore sta dove il modello sbaglia di piu':** compra l'ala piu' lontana (δ lungo
0.05), come 5/10 della top-10, cioe' esattamente la gamba che il 30/07 ha MISURATO
sottoprezzata (~2.3x, IVDVOL +7.5pp). Sospetto motivato, **non dimostrazione**: il mediano non
separa 0.10 da 0.05 (1.37 vs 1.37), si separa la coda alta. Ma `f` **non e' misurato** fuori
dalla struttura canonica, e la sensibilita' a f uniforme (cella scelta 0.84 vs canonico 0.47 a
f=0.73) **e' la lente sbagliata** per una struttura il cui errore e' concentrato in una gamba.
**"Il vincitore sta dove il modello sbaglia di piu'" — MIO ARGOMENTO, MISURATO E REFUTATO
LO STESSO GIORNO** (5° filone, sotto): l'ala a δ−0.05 e' molto piu' mispriced in RELATIVO
(f_long **5.85** contro 2.23) ma pesa il **3.2%** del premio corto invece del **18.4%**, quindi
sul credito NETTO l'effetto e' MINORE → f_net **0.852** contro **0.718**: il candidato ha un f
**migliore**, non peggiore. Meccanismo giusto, conclusione rovesciata. **La decisione (nessun
cambio) regge, ma su tre gambe invece di quattro:** gate DSR, regione nuova perdente,
ineseguibilita' sotto ~$2.6k.
⚠️ **Robustezza del verdetto, pubblicata:** DSR **0.983 PASS a N=8** / **0.948 FAIL a N=72** /
0.909 a N=360 → **il verdetto si ribalta col conteggio**. La griglia era dichiarata in anticipo e
il conto fatto al rialzo, ma **fallisce per 0.002**: si cita come tale, non come refutazione
@@ -228,6 +229,36 @@ Prima ondata di ricerca onesta su BTC/ETH certificati (5 track, harness condivis
che dentro **non c'e' niente** che bocciando il candidato; (d) se la selezione converge dove un
difetto di modello e' gia' misurato, **il sospetto vale piu' del numero** — e si dice che e' un
sospetto.
**f MISURATO SULLE STRUTTURE, e sorvegliante cablato (2026-07-30, 5° filone).**
`scripts/live/vrp_f_watch.py` (in `cron_daily.sh`), test `tests/test_vrp_f_watch.py` (11),
diario `2026-07-30-vrp-f-strutture.md`. **Book/pesi/config INVARIATI.** Il campione c'era gia':
**8 scadenze utilizzabili per asset su 8**, entrambe le strutture, 16 osservazioni ciascuna.
| struttura | f_short | f_long | quota ala/corta | **f_net** |
|---|---|---|---|---|
| canonico 7g δ−0.10 | 1.013 | 2.233 | 18.4% | **0.718** |
| candidato 10g δ−0.05 | 0.972 | **5.846** | **3.2%** | **0.852** |
Aritmetica che rende ovvio l'errore: `f_net = (f_short k·f_long)/(1 k)` con
`k = premio_lungo/premio_corto` → **un f_long grande fa danno solo moltiplicato per un k
grande**. ⚠️ Artefatto di tick ESCLUSO prima di crederci: l'ask dell'ala sta a **22 tick**
mediani (min 15, **0%** a ≤2 tick).
**La DIFFERENZA non e' stabilita:** appaiata per (asset, scadenza) fa **+0.109 IC95
[0.047, +0.193]**, 11/16 positive → **contiene lo zero**. ✅ Replica indipendente del canonico
(**0.718** per un percorso con finestra DTE e pairing diversi da quello che dava 0.73).
Al proprio f: canonico **0.43**, candidato **1.18**.
**CRITERIO PRE-REGISTRATO (dichiarato prima del campione pieno, congelato in un test):
≥40 coppie E ampiezza IC95 ≤0.12** (oggi 16 e 0.241) → prima gamba verso **fine ottobre 2026**;
il sorvegliante rifa' la misura ogni giorno e **notifica una volta sola** quando basta (lezione
DVOLSPREAD: un lead senza sorvegliante e senza data e' un lead perso).
⚠️ **Calibrazione della soglia verificata prima di fidarsene:** con differenza vera nulla lo
zero e' escluso nel **5.0/4.0/3.0%** dei casi a n=16/40/60 = il 5% atteso. (Il test iniziale su
seed fisso falliva perche' quel seed era uno dei 5% legittimi → sostituito con un test sulla
PROPRIETA', 100 estrazioni.)
**NON promuove nulla:** il candidato resta bocciato sul deflated-Sharpe, che non dipende da f.
**REGOLE:** (a) **un fattore di errore si giudica moltiplicato per il suo peso** — 5.85 al 3%
fa meno danno di 2.23 al 18%, e guardare il fattore senza il peso da' la conclusione opposta a
quella vera; (b) prima di credere a un rapporto estremo su un prezzo piccolo, **contare i tick**;
(c) una soglia sull'ampiezza di un IC richiede di **verificare la copertura** di quell'IC;
(d) *"non abbastanza campione" non e' "nessuna differenza"* — si aspetta con una data.
💰 **A $3.000 la domanda non e' il rendimento** (`min_trade_amount` letti dal venue il 30/07):
**BTC min 0.1 = $6.210 di collaterale/lotto → FUORI**; ETH min 1 contratto = $1.832 → **1 lotto**.
Il sleeve 50/50 **diventa ETH-only**, e **al peso di book (12% = $360) sono 0 lotti** — servirebbe