Files
PythagorasGoal/docs/memory/50-dati-e-feed.md
T
Adriano Dal Pastro b237ad2e8b docs: compattazione di CLAUDE.md — 3458 -> 424 righe, memoria in docs/memory/
CLAUDE.md era arrivato a 310 KB (~80k token caricati a OGNI sessione) e la
sua funzione si era sdoppiata: era insieme il manuale operativo e l'archivio
di 69 filoni di ricerca. Le due cose hanno lettori diversi.

I 65 bullet-blocco sono stati spostati VERBATIM in docs/memory/ (nulla
riscritto). Verifica meccanica riga per riga prima del commit: 3272 righe
non vuote, 0 mancanti, 0 aggiunte, zero buchi e zero sovrapposizioni nella
copertura delle regioni estratte.

  10-sleeve-e-candidati.md    30 KB  TP01 XS01 VRP01 SKH01 GTAA01 XSR01
  20-ondate-e-scartati.md    126 KB  69 filoni, ogni scartato col suo perche'
  30-piano-capitale-fisco.md  59 KB  muri, versamenti, venue risk, fisco, prop
  40-produzione-e-deploy.md   66 KB  esecutore, tripwire, monitor, PRIIPs/UCITS
  50-dati-e-feed.md           14 KB  difetti del dato, catena opzioni
  60-metodo-e-gate.md          4 KB  i gate di altlib.py

In CLAUDE.md resta solo cio' che serve a non sbagliare una decisione: stato,
book live vs book di ricerca, i numeri da citare e quelli da NON citare,
7 decisioni vincolanti dell'operatore con "cosa le riapre", 6 gate
pre-registrati con la data, 9 debiti aperti non riparati, le regole di
prim'ordine (D/M/C/P/N, distillate dalle 113 righe che contenevano REGOLA),
IL DATO, metodologia, stack/struttura/comandi.

Tre fatti che erano sepolti in 3400 righe e ora stanno in testa: le TRE
baseline diverse che girano sotto il nome "libro 75/25" (spread piu' grande
di quasi tutti gli effetti misurati), il funding non modellato in nessun
backtest (-2,16%/anno), e che «N/N ancore» vale ~2 osservazioni.

Verificato prima del commit: 36/36 percorsi citati esistono su disco,
708 test collezionati, code fence bilanciati. Nessun file di codice toccato.

Convenzione aggiunta (§14) perche' il file non torni a crescere: quando un
risultato CAMBIA UNA DECISIONE si aggiorna CLAUDE.md; quando aggiunge
racconto, va in docs/memory/.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-25 08:50:02 +00:00

14 KiB
Raw Blame History

Dati, feed e difetti trovati

Estratto verbatim da CLAUDE.md il 2026-08-25 durante la compattazione. Difetti del dato scoperti e riparati, e la catena opzioni raccolta in proprio. Il testo non e' stato riscritto: e' la memoria originale, spostata.


  • SPLIT NON AGGIUSTATI nel feed equity — difetto sul LIBRO LIVE, riparato (2026-07-25). data/raw/eq_iwm_1d.parquet ed eq_efa_1d.parquet avevano uno split non aggiustato il 2005-06-09 (IWM 2:1 = 49.5%; EFA 3:1 = 66.5%); IB ADJUSTED_LAST non li aveva aggiustati. La certificazione non li vedeva per un punto cieco strutturale: l'unica guardia era maxret > 50% → SPIKE? e uno split 2:1 fa esattamente 50% → IWM passava a 49.5% con status OK. IWM e' una delle 6 gambe di GTAA01 in produzione. Impatto: GTAA6 FULL Sh 0.61→0.64, IS 0.49→0.54, OOS 2015+ e maxDD INVARIATI (artefatto nel 2005, fuori hold-out) → il difetto SOTTOSTIMAVA lo sleeve, nessuna decisione presa va rivista. Discriminante split-vs-crollo (riusabile): non il rapporto (SLV 2026-01-30 ha rapporto 1.3994, a 4bps da 1.4, ma e' un crollo vero: GLD 10.3% lo stesso giorno) ma il RANGE INTRADAY — lo split apre gia' al nuovo livello con range normale (IWM: open 47.00, range 1.7%), il crollo si muove DENTRO la barra (SLV: range 33%). Modulo src/data/eq_splits.py (detect_unadjusted_splits a 3 condizioni congiunte + repair_splits componibile), riparazione in lettura in src/portfolio/gtaa.py::_close e scripts/research/eqlib.py::load_eq, status SPLIT-NON-AGG in fetch_ib_equities.certify(), test tests/test_eq_splits.py (8 casi). Regola nuova: ogni soglia di certificazione tarata su un valore tondo va controllata contro il difetto che genera esattamente quel valore (una soglia a 50% non puo' sorvegliare gli split 2:1).

  • ⚠️ IL FEED EQUITY NON AVEVA UN CROSS-CHECK — buco trovato e chiuso (2026-07-26). src/data/eq_crosscheck.py. Nel crypto la certificazione incrocia sempre piu' venue (certify_feed.py vs Coinbase USD); il feed equity aveva solo controlli locali (integrita', gap, spike, split). Il primo veicolo estero ha trovato il buco alla prima estrazione: CSPX 2012-01-13 con open/high 112.740 in USD e low/close 88.010 in EUR (fattore dai close adiacenti 1.2797 = EURUSD di quel giorno) → 21.9% e poi +27.8% mentre SPY faceva 0.39%. La certificazione esistente non lo vedeva: unica guardia maxret > 50% → SPIKE?, e una contaminazione EUR/USD vale ~22-28% — stesso schema dello split 2:1 del 25/07 (che valeva esattamente 50%). 2ª conferma: una soglia tarata su una classe di difetto non sorveglia le altre. Perche' il GEMELLO e non una regola locale: il discriminante del 25/07 (range intraday) qui non funziona — anche un crollo vero ha range enorme (SLV 33%). Cio' che separa i casi e' che un evento di mercato lo fa anche il gemello: nel rapporto i movimenti veri si cancellano. Controprova su dati reali: la scansione sui prezzi segnalava IDTL 2020-03 (liquidazione treasury) e IGLN 2013-04 (crollo oro); sul rapporto spariscono. ⚠️ La soglia non era tarabile sulla deviazione — rumore legittimo fino al 9.90% (2025-04-09: Londra chiude alle 11:30 di New York) contro un difetto del 21.4% → margine 2.2×, sotto il 3× richiesto. La risposta non e' accettare il margine ma CAMBIARE STATISTICA: |dev| / movimento del gemello (un disallineamento d'orario non puo' superare il movimento del mercato) → rumore 8.1, difetto 42.7, margine 5.3×. Soglia 18.0, equidistante in scala log. Tre condizioni congiunte: deviazione + non-spiegato + rientro entro 5 barre. Riparazione = SCARTARE la barra, non ricostruirla (del prezzo vero non si sa nulla). ⚠️ Limite dichiarato e chiuso sul DANNO, non sulla rilevabilita': GBPUSD 1.27 → 21% sempre rilevato; EURUSD 1.09 → 8.3% dentro il rumore e non tappabile senza falsi positivi. Misurato invece il danno di una contaminazione non vista: dSharpe mediano 0.003, peggiore 0.056, |Δ|>0.05 nel 2%. REGOLA: quando un buco non si puo' chiudere senza generare falsi positivi, si misura il DANNO del caso non rilevato — un buco quantificato e innocuo e' un risultato, uno taciuto e' un debito. Il limite e' congelato in un test (test_limite_dichiarato_*): se qualcuno abbassa la soglia, il test dice cosa e' cambiato.

  • CATENA OPZIONI REALE — RACCOLTA PROPRIA dal 2026-07-30 (cerbero-bite ASSORBITO e dismesso). /opt/docker/cerbero-bite (progetto separato) accumulava dal 2026-06-09 la catena Deribit mainnet BTC+ETH; è stato ELIMINATO il 2026-07-30 (container, volume, immagine e cartella rimossi, 12 GB liberati; codice conservato su Gitea Adriano/Cerbero-Bite, ultimo commit di dismissione) e la raccolta è passata dentro PythagorasGoal:

    • raccolta: scripts/live/collect_chain.py, cron 25 * * * * (scripts/cron_chain.sh) → data/raw/cb_chain/YYYY-MM-DD.parquet. Entrambe le ali, scadenze ≤95g, OI≥100, ~570 strumenti a giro, ~3 min. Minuto :25 scelto, non arbitrario: :00 era la raffica di bite, :07 è cron_book (feed 5m di SKH01, la cosa che non deve trovare l'IP occupato).
    • archivio ereditato: scripts/analysis/import_cb_archive.py (una-tantum) → cb_chain/bite_archive.parquet (1.23M righe, 2026-05-01+) e cb_market_snapshots.parquet (17.402 righe, 2026-03-26+: DVOL, RV30, funding perp e cross, dealer net gamma, gamma flip, rischio liquidazioni, giorni all'evento macro — dati che il progetto non ha altrove). Snapshot sqlite integrale in /opt/docker/backups/manual/cerbero-bite-20260730/ (SHA256).
    • certificazione: scripts/analysis/certify_cb_chain.py; harness scripts/research/cblib.py (load_chain() unisce archivio + raccolta, dedup su (ts, strumento)).
    • battuta di cuore: ogni giro scrive data/chain_collect/runs.jsonl, sorvegliato da monitor_health (cadenza 1h, max_age_h=3) — un collettore fermo non produce niente, e il niente si legge come "nessun dato quel giorno".
    • BACKUP (aggiunto 2026-07-30): data/raw/ è gitignored → la catena non è in git, e il backup rotativo della VPS non copriva PythagorasGoal. Aggiunta do_pythagoras a /opt/docker/scripts/backup.sh (daily 04:00, retention 7/28/185 g): salva solo il dato non ricostruibile — catena + contesto, data/paper_* e data/chain_collect (serie forward-only che alimentano i gate pre-registrati: non sono ricalcolabili), data/options_daily, data/live, venue_watch, fee_watch, config/live.json. ~28 MB. Esclusi di proposito i ~110 MB ricostruibili (rebuild_history.py, fetch_dvol.py, fetch_hyperliquid.py, fetch_ib_equities.py, cache). La funzione fallisce rumorosamente se la catena è assente o vuota, e verifica il tar prodotto (controllo positivo provato in entrambi i versi). ⚠️ /opt/docker/scripts non è un repo git: quella modifica vive solo su disco.
    • Dopo un riavvio della VPS la raccolta riprende da sola (cron di sistema enabled+active, nessuna dipendenza da docker o da cerbero-mcp: API pubblica Deribit diretta). Verificato con env -i che il giro funzioni nell'ambiente nudo di cron. Finestra scoperta: fino al :25 successivo, senza recupero — un'ora persa resta persa (il collettore non fa catch-up). TRE DIFETTI DI BITE NON REPLICATI (misurati il 30/07): (a) una chiamata per strumentoget_order_book?depth=3 dà già quote+greche+IV+OI+book+underlying, bite ne faceva due con rischio di disallineamento; (b) pacing (token bucket 4/s + backoff) invece della raffica — il carico non è mai stato il problema (~570 chiamate/ora = 0.16/s distribuite), bite le sparava in ~26s (~44/s) auto-saturandosi il rate limit per-IP; misurato sul nostro giro: 574 chiamate, 0 risposte 429; (c) quote_status esplicito in {ok, no_quote, error} — "book vuoto" (fatto di mercato) e "chiamata fallita" (fatto di infrastruttura) sono cose diverse, e book_depth_top3 è NULL su errore, mai 0. ⚠️ Le righe ereditate da bite hanno quote_status='unknown': bite non registrava il perché, e si dichiara l'ignoranza invece di inventare uno stato. 🚨 BUCO DI COLONNA nell'archivio ereditato, trovato il 2026-08-22 e mai registrato prima: bite_archive ha index_price e underlying_price 100% None (1.232.212/1.232.212). Il sottostante esiste solo dal 2026-07-30 (raccolta propria, 18,2% delle righe) e book_depth_top3 solo nel 67,2%. Chiunque calcoli moneyness o riprezzi sull'archivio pre-30/07 sta usando una colonna che non c'è — e il file si legge senza errori, quindi il difetto è silenzioso. Ed è CHIUDIBILE senza dato nuovo: il forward si ricostruisce con la parità put-call dalla catena stessa — verificato contro l'osservato su 6.578 coppie: |errore| mediano 0,023%, p95 0,147%, corr 1,000000 → rende la superficie utilizzabile su tutti i 75 giorni invece che 23. (Lo smile, che non richiede il forward, esiste invece su 113 giorni dal 2026-05-01; la superficie completa solo da 2026-06-09, perché prima bite raccoglieva una sola scadenza per giro — misurato da tre agenti indipendenti.) ⚠️ La famiglia raccolta è quella inverse (get_instruments?currency=BTC|ETH): la superficie USDC-lineare non è nell'archivio, e ogni conclusione su di essa nel progetto è oggi un controfattuale costruito sui mid inverse, non una misura. Puntare il collettore anche su currency=USDC costa +587 chiamate/giro (+90%) 🚨 CORRETTO 2026-08-23 (§51): sono +117 chiamate = +18%. Il 587 era il conteggio grezzo (1.140 strumenti USDC ≤ 95g = +81%) senza il filtro OI≥100 che il collettore applica davvero, e quel filtro taglia il 90% della famiglia USDC: con gli stessi filtri del collettore vivo sono 113 strumenti contro 649 inverse ( verificato al venue da due percorsi indipendenti; replica esatta di §8 — su Deribit USDC l'OI e la negoziabilità sono anti-correlati). Il giro passerebbe da 652 chiamate/163 s a 769/192 s, dentro la finestra del :25 e senza toccare cron_book al :07. Resta una decisione sul rate-limit per-IP, che ha già causato un guasto il 29/07 — ma di un ordine di grandezza più piccola di come era stata scritta, ed è un numero di oggi (cresce con la liquidità USDC, va ri-misurato prima di accendere). 🚨 LA RAGIONE PER RACCOGLIERLA E' CADUTA (2026-08-23, §64): le due superfici sono LA STESSA SUPERFICIE a strike appaiati — prezzo equo identico per costruzione, mezzo-spread Δ 0,21/0,38 pp, f_venue Δ +0,005/0,011 ⇒ il f di VRP01 misurato sull'inverse non e' «il numero della famiglia sbagliata», e' lo stesso numero. Resta vero che la lineare non e' nell'archivio; cade l'argomento che la sua assenza falsi una misura gia' fatta. NON assorbito, e perché: il motore credit-spread ETH (il progetto ha già la regola "niente short-vol da modello in deploy"), la GUI, kill switch/dead-man/audit (PythagorasGoal ha venue_watch/edge_watch/monitor_health/fee_watch), dvol_history (fetch_dvol.py ha storia più lunga: 2020+ contro 2026-05), decisions/positions (59 righe a capitale $52, 0 posizioni). Test tests/test_collect_chain.py (11) + tests/test_cb_chain_vrp.py (13). ⚠️ Prima di cancellare la sorgente (verifiche nel diario 2026-07-30-assorbimento-cerbero-bite.md): snapshot completo e non solo integro (4 tabelle su 4 con conteggi identici al volume vivo e ai parquet); i 10,6 GB di backup interni non contenevano dati unici (stessa riga più vecchia in tutti gli snapshot + conteggi monotoni ⇒ nessuna potatura); zero dipendenze a runtime. ⚠️ cerbero-mcp è un progetto DIVERSO e serve a PythagorasGoal (Hyperliquid, percorso del conto) — resta acceso; la rete traefik che condividevano è external: nel compose di bite, quindi down -v non la tocca. REGOLA: prima di cancellare una sorgente si verifica che la copia sia COMPLETA, non che esista — un hash prova che il file non è corrotto, non che contenga tutto. Perché si MEMORIZZA invece di interrogarla: una catena opzioni non è ricostruibile a posteriori — Deribit non serve book storici, un'ora non raccolta è persa per sempre, e non c'è un secondo venue da cui recuperarla. Certifica 4 difetti: quote vuote, book incrociato, premio non monotono nello strike, depth==0 (ambiguo by design: chiamata fallita e book vuoto danno lo stesso valore → si riporta, non si ripara). ⚠️ GUASTO IN CORSO dal 2026-07-29 05:00 UTC — status QUOTE-VUOTE. Il collettore persiste la riga anche quando il ticker fallisce (rate-limit Deribit per-IP: ~650 risposte 429 in ~26s a ogni giro, 96% al minuto :00, generate dalla spazzata full-chain che si auto-satura) → bid/ask/iv/delta NULL e conteggio righe INVARIATO (13k/giorno prima e dopo). Tasso di quote vuote per settimana: 0.4·0.7·2.2·1.5·0.5·0.4·0.3 → 22%; giorno peggiore 51.7% BTC / 30.6% ETH. Risolto dal cambio di collettore (30/07): la raccolta propria è paced e ha fatto 574 chiamate con 0 risposte 429. REGOLA: una riga presente non è un dato presente — contare ciò che è QUOTATO, non ciò che è SCRITTO (3ª occorrenza dopo paper_dvolspread e fresh_5m). REGOLA: un guasto IN CORSO si misura al GIORNO PEGGIORE, non in media — la prima stesura confrontava "tutto" con "ultimi 7g" e diluiva un guasto di 2 giorni al 13.5%, commettendo a 7 giorni lo stesso errore che dichiarava di evitare a 3 mesi. Diario 2026-07-30-vrp-quote-reali.md.