CLAUDE.md era arrivato a 310 KB (~80k token caricati a OGNI sessione) e la sua funzione si era sdoppiata: era insieme il manuale operativo e l'archivio di 69 filoni di ricerca. Le due cose hanno lettori diversi. I 65 bullet-blocco sono stati spostati VERBATIM in docs/memory/ (nulla riscritto). Verifica meccanica riga per riga prima del commit: 3272 righe non vuote, 0 mancanti, 0 aggiunte, zero buchi e zero sovrapposizioni nella copertura delle regioni estratte. 10-sleeve-e-candidati.md 30 KB TP01 XS01 VRP01 SKH01 GTAA01 XSR01 20-ondate-e-scartati.md 126 KB 69 filoni, ogni scartato col suo perche' 30-piano-capitale-fisco.md 59 KB muri, versamenti, venue risk, fisco, prop 40-produzione-e-deploy.md 66 KB esecutore, tripwire, monitor, PRIIPs/UCITS 50-dati-e-feed.md 14 KB difetti del dato, catena opzioni 60-metodo-e-gate.md 4 KB i gate di altlib.py In CLAUDE.md resta solo cio' che serve a non sbagliare una decisione: stato, book live vs book di ricerca, i numeri da citare e quelli da NON citare, 7 decisioni vincolanti dell'operatore con "cosa le riapre", 6 gate pre-registrati con la data, 9 debiti aperti non riparati, le regole di prim'ordine (D/M/C/P/N, distillate dalle 113 righe che contenevano REGOLA), IL DATO, metodologia, stack/struttura/comandi. Tre fatti che erano sepolti in 3400 righe e ora stanno in testa: le TRE baseline diverse che girano sotto il nome "libro 75/25" (spread piu' grande di quasi tutti gli effetti misurati), il funding non modellato in nessun backtest (-2,16%/anno), e che «N/N ancore» vale ~2 osservazioni. Verificato prima del commit: 36/36 percorsi citati esistono su disco, 708 test collezionati, code fence bilanciati. Nessun file di codice toccato. Convenzione aggiunta (§14) perche' il file non torni a crescere: quando un risultato CAMBIA UNA DECISIONE si aggiorna CLAUDE.md; quando aggiunge racconto, va in docs/memory/. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
14 KiB
Dati, feed e difetti trovati
Estratto verbatim da
CLAUDE.mdil 2026-08-25 durante la compattazione. Difetti del dato scoperti e riparati, e la catena opzioni raccolta in proprio. Il testo non e' stato riscritto: e' la memoria originale, spostata.
-
⚠ SPLIT NON AGGIUSTATI nel feed equity — difetto sul LIBRO LIVE, riparato (2026-07-25).
data/raw/eq_iwm_1d.parquetedeq_efa_1d.parquetavevano uno split non aggiustato il 2005-06-09 (IWM 2:1 = −49.5%; EFA 3:1 = −66.5%); IBADJUSTED_LASTnon li aveva aggiustati. La certificazione non li vedeva per un punto cieco strutturale: l'unica guardia eramaxret > 50% → SPIKE?e uno split 2:1 fa esattamente −50% → IWM passava a 49.5% con status OK. IWM e' una delle 6 gambe di GTAA01 in produzione. Impatto: GTAA6 FULL Sh 0.61→0.64, IS 0.49→0.54, OOS 2015+ e maxDD INVARIATI (artefatto nel 2005, fuori hold-out) → il difetto SOTTOSTIMAVA lo sleeve, nessuna decisione presa va rivista. Discriminante split-vs-crollo (riusabile): non il rapporto (SLV 2026-01-30 ha rapporto 1.3994, a 4bps da 1.4, ma e' un crollo vero: GLD −10.3% lo stesso giorno) ma il RANGE INTRADAY — lo split apre gia' al nuovo livello con range normale (IWM: open 47.00, range 1.7%), il crollo si muove DENTRO la barra (SLV: range 33%). Modulosrc/data/eq_splits.py(detect_unadjusted_splitsa 3 condizioni congiunte +repair_splitscomponibile), riparazione in lettura insrc/portfolio/gtaa.py::_closeescripts/research/eqlib.py::load_eq, statusSPLIT-NON-AGGinfetch_ib_equities.certify(), testtests/test_eq_splits.py(8 casi). Regola nuova: ogni soglia di certificazione tarata su un valore tondo va controllata contro il difetto che genera esattamente quel valore (una soglia a 50% non puo' sorvegliare gli split 2:1). -
⚠️ IL FEED EQUITY NON AVEVA UN CROSS-CHECK — buco trovato e chiuso (2026-07-26).
src/data/eq_crosscheck.py. Nel crypto la certificazione incrocia sempre piu' venue (certify_feed.pyvs Coinbase USD); il feed equity aveva solo controlli locali (integrita', gap, spike, split). Il primo veicolo estero ha trovato il buco alla prima estrazione: CSPX 2012-01-13 conopen/high 112.740in USD elow/close 88.010in EUR (fattore dai close adiacenti 1.2797 = EURUSD di quel giorno) → −21.9% e poi +27.8% mentre SPY faceva −0.39%. La certificazione esistente non lo vedeva: unica guardiamaxret > 50% → SPIKE?, e una contaminazione EUR/USD vale ~22-28% — stesso schema dello split 2:1 del 25/07 (che valeva esattamente −50%). 2ª conferma: una soglia tarata su una classe di difetto non sorveglia le altre. Perche' il GEMELLO e non una regola locale: il discriminante del 25/07 (range intraday) qui non funziona — anche un crollo vero ha range enorme (SLV 33%). Cio' che separa i casi e' che un evento di mercato lo fa anche il gemello: nel rapporto i movimenti veri si cancellano. Controprova su dati reali: la scansione sui prezzi segnalava IDTL 2020-03 (liquidazione treasury) e IGLN 2013-04 (crollo oro); sul rapporto spariscono. ⚠️ La soglia non era tarabile sulla deviazione — rumore legittimo fino al 9.90% (2025-04-09: Londra chiude alle 11:30 di New York) contro un difetto del 21.4% → margine 2.2×, sotto il 3× richiesto. La risposta non e' accettare il margine ma CAMBIARE STATISTICA:|dev| / movimento del gemello(un disallineamento d'orario non puo' superare il movimento del mercato) → rumore 8.1, difetto 42.7, margine 5.3×. Soglia 18.0, equidistante in scala log. Tre condizioni congiunte: deviazione + non-spiegato + rientro entro 5 barre. Riparazione = SCARTARE la barra, non ricostruirla (del prezzo vero non si sa nulla). ⚠️ Limite dichiarato e chiuso sul DANNO, non sulla rilevabilita': GBPUSD 1.27 → 21% sempre rilevato; EURUSD 1.09 → 8.3% dentro il rumore e non tappabile senza falsi positivi. Misurato invece il danno di una contaminazione non vista: dSharpe mediano −0.003, peggiore −0.056, |Δ|>0.05 nel 2%. REGOLA: quando un buco non si puo' chiudere senza generare falsi positivi, si misura il DANNO del caso non rilevato — un buco quantificato e innocuo e' un risultato, uno taciuto e' un debito. Il limite e' congelato in un test (test_limite_dichiarato_*): se qualcuno abbassa la soglia, il test dice cosa e' cambiato. -
CATENA OPZIONI REALE — RACCOLTA PROPRIA dal 2026-07-30 (cerbero-bite ASSORBITO e dismesso).
/opt/docker/cerbero-bite(progetto separato) accumulava dal 2026-06-09 la catena Deribit mainnet BTC+ETH; è stato ELIMINATO il 2026-07-30 (container, volume, immagine e cartella rimossi, 12 GB liberati; codice conservato su GiteaAdriano/Cerbero-Bite, ultimo commit di dismissione) e la raccolta è passata dentro PythagorasGoal:- raccolta:
scripts/live/collect_chain.py, cron25 * * * *(scripts/cron_chain.sh) →data/raw/cb_chain/YYYY-MM-DD.parquet. Entrambe le ali, scadenze ≤95g, OI≥100, ~570 strumenti a giro, ~3 min. Minuto :25 scelto, non arbitrario: :00 era la raffica di bite, :07 ècron_book(feed 5m di SKH01, la cosa che non deve trovare l'IP occupato). - archivio ereditato:
scripts/analysis/import_cb_archive.py(una-tantum) →cb_chain/bite_archive.parquet(1.23M righe, 2026-05-01+) ecb_market_snapshots.parquet(17.402 righe, 2026-03-26+: DVOL, RV30, funding perp e cross, dealer net gamma, gamma flip, rischio liquidazioni, giorni all'evento macro — dati che il progetto non ha altrove). Snapshot sqlite integrale in/opt/docker/backups/manual/cerbero-bite-20260730/(SHA256). - certificazione:
scripts/analysis/certify_cb_chain.py; harnessscripts/research/cblib.py(load_chain()unisce archivio + raccolta, dedup su(ts, strumento)). - battuta di cuore: ogni giro scrive
data/chain_collect/runs.jsonl, sorvegliato damonitor_health(cadenza 1h,max_age_h=3) — un collettore fermo non produce niente, e il niente si legge come "nessun dato quel giorno". - BACKUP (aggiunto 2026-07-30):
data/raw/è gitignored → la catena non è in git, e il backup rotativo della VPS non copriva PythagorasGoal. Aggiuntado_pythagorasa/opt/docker/scripts/backup.sh(daily 04:00, retention 7/28/185 g): salva solo il dato non ricostruibile — catena + contesto,data/paper_*edata/chain_collect(serie forward-only che alimentano i gate pre-registrati: non sono ricalcolabili),data/options_daily,data/live,venue_watch,fee_watch,config/live.json. ~28 MB. Esclusi di proposito i ~110 MB ricostruibili (rebuild_history.py,fetch_dvol.py,fetch_hyperliquid.py,fetch_ib_equities.py, cache). La funzione fallisce rumorosamente se la catena è assente o vuota, e verifica il tar prodotto (controllo positivo provato in entrambi i versi). ⚠️/opt/docker/scriptsnon è un repo git: quella modifica vive solo su disco. - Dopo un riavvio della VPS la raccolta riprende da sola (cron di sistema
enabled+active, nessuna dipendenza da docker o da cerbero-mcp: API pubblica Deribit diretta). Verificato conenv -iche il giro funzioni nell'ambiente nudo di cron. Finestra scoperta: fino al:25successivo, senza recupero — un'ora persa resta persa (il collettore non fa catch-up). TRE DIFETTI DI BITE NON REPLICATI (misurati il 30/07): (a) una chiamata per strumento —get_order_book?depth=3dà già quote+greche+IV+OI+book+underlying, bite ne faceva due con rischio di disallineamento; (b) pacing (token bucket 4/s + backoff) invece della raffica — il carico non è mai stato il problema (~570 chiamate/ora = 0.16/s distribuite), bite le sparava in ~26s (~44/s) auto-saturandosi il rate limit per-IP; misurato sul nostro giro: 574 chiamate, 0 risposte 429; (c)quote_statusesplicito in {ok,no_quote,error} — "book vuoto" (fatto di mercato) e "chiamata fallita" (fatto di infrastruttura) sono cose diverse, ebook_depth_top3è NULL su errore, mai 0. ⚠️ Le righe ereditate da bite hannoquote_status='unknown': bite non registrava il perché, e si dichiara l'ignoranza invece di inventare uno stato. 🚨 BUCO DI COLONNA nell'archivio ereditato, trovato il 2026-08-22 e mai registrato prima:bite_archivehaindex_priceeunderlying_price100% None (1.232.212/1.232.212). Il sottostante esiste solo dal 2026-07-30 (raccolta propria, 18,2% delle righe) ebook_depth_top3solo nel 67,2%. Chiunque calcoli moneyness o riprezzi sull'archivio pre-30/07 sta usando una colonna che non c'è — e il file si legge senza errori, quindi il difetto è silenzioso. ✅ Ed è CHIUDIBILE senza dato nuovo: il forward si ricostruisce con la parità put-call dalla catena stessa — verificato contro l'osservato su 6.578 coppie: |errore| mediano 0,023%, p95 0,147%, corr 1,000000 → rende la superficie utilizzabile su tutti i 75 giorni invece che 23. (Lo smile, che non richiede il forward, esiste invece su 113 giorni dal 2026-05-01; la superficie completa solo da 2026-06-09, perché prima bite raccoglieva una sola scadenza per giro — misurato da tre agenti indipendenti.) ⚠️ La famiglia raccolta è quella inverse (get_instruments?currency=BTC|ETH): la superficie USDC-lineare non è nell'archivio, e ogni conclusione su di essa nel progetto è oggi un controfattuale costruito sui mid inverse, non una misura. Puntare il collettore anche sucurrency=USDCcosta+587 chiamate/giro (+90%)🚨 CORRETTO 2026-08-23 (§51): sono +117 chiamate = +18%. Il 587 era il conteggio grezzo (1.140 strumenti USDC ≤ 95g = +81%) senza il filtro OI≥100 che il collettore applica davvero, e quel filtro taglia il 90% della famiglia USDC: con gli stessi filtri del collettore vivo sono 113 strumenti contro 649 inverse (✅ verificato al venue da due percorsi indipendenti; replica esatta di §8 — su Deribit USDC l'OI e la negoziabilità sono anti-correlati). Il giro passerebbe da 652 chiamate/163 s a 769/192 s, dentro la finestra del :25 e senza toccarecron_bookal :07. Resta una decisione sul rate-limit per-IP, che ha già causato un guasto il 29/07 — ma di un ordine di grandezza più piccola di come era stata scritta, ed è un numero di oggi (cresce con la liquidità USDC, va ri-misurato prima di accendere). 🚨 LA RAGIONE PER RACCOGLIERLA E' CADUTA (2026-08-23, §64): le due superfici sono LA STESSA SUPERFICIE a strike appaiati — prezzo equo identico per costruzione, mezzo-spread Δ −0,21/−0,38 pp,f_venueΔ +0,005/−0,011 ⇒ ilfdi VRP01 misurato sull'inverse non e' «il numero della famiglia sbagliata», e' lo stesso numero. Resta vero che la lineare non e' nell'archivio; cade l'argomento che la sua assenza falsi una misura gia' fatta. NON assorbito, e perché: il motore credit-spread ETH (il progetto ha già la regola "niente short-vol da modello in deploy"), la GUI, kill switch/dead-man/audit (PythagorasGoal havenue_watch/edge_watch/monitor_health/fee_watch),dvol_history(fetch_dvol.pyha storia più lunga: 2020+ contro 2026-05),decisions/positions(59 righe a capitale $52, 0 posizioni). Testtests/test_collect_chain.py(11) +tests/test_cb_chain_vrp.py(13). ⚠️ Prima di cancellare la sorgente (verifiche nel diario2026-07-30-assorbimento-cerbero-bite.md): snapshot completo e non solo integro (4 tabelle su 4 con conteggi identici al volume vivo e ai parquet); i 10,6 GB di backup interni non contenevano dati unici (stessa riga più vecchia in tutti gli snapshot + conteggi monotoni ⇒ nessuna potatura); zero dipendenze a runtime. ⚠️cerbero-mcpè un progetto DIVERSO e serve a PythagorasGoal (Hyperliquid, percorso del conto) — resta acceso; la retetraefikche condividevano èexternal:nel compose di bite, quindidown -vnon la tocca. REGOLA: prima di cancellare una sorgente si verifica che la copia sia COMPLETA, non che esista — un hash prova che il file non è corrotto, non che contenga tutto. Perché si MEMORIZZA invece di interrogarla: una catena opzioni non è ricostruibile a posteriori — Deribit non serve book storici, un'ora non raccolta è persa per sempre, e non c'è un secondo venue da cui recuperarla. Certifica 4 difetti: quote vuote, book incrociato, premio non monotono nello strike,depth==0(ambiguo by design: chiamata fallita e book vuoto danno lo stesso valore → si riporta, non si ripara). ⚠️ GUASTO IN CORSO dal 2026-07-29 05:00 UTC — statusQUOTE-VUOTE. Il collettore persiste la riga anche quando il ticker fallisce (rate-limit Deribit per-IP: ~650 risposte 429 in ~26s a ogni giro, 96% al minuto :00, generate dalla spazzata full-chain che si auto-satura) →bid/ask/iv/deltaNULL e conteggio righe INVARIATO (13k/giorno prima e dopo). Tasso di quote vuote per settimana: 0.4·0.7·2.2·1.5·0.5·0.4·0.3 → 22%; giorno peggiore 51.7% BTC / 30.6% ETH. ✅ Risolto dal cambio di collettore (30/07): la raccolta propria è paced e ha fatto 574 chiamate con 0 risposte 429. REGOLA: una riga presente non è un dato presente — contare ciò che è QUOTATO, non ciò che è SCRITTO (3ª occorrenza dopopaper_dvolspreadefresh_5m). REGOLA: un guasto IN CORSO si misura al GIORNO PEGGIORE, non in media — la prima stesura confrontava "tutto" con "ultimi 7g" e diluiva un guasto di 2 giorni al 13.5%, commettendo a 7 giorni lo stesso errore che dichiarava di evitare a 3 mesi. Diario2026-07-30-vrp-quote-reali.md.
- raccolta: