Files
PythagorasGoal/docs/diary/2026-08-22-wave2-xs01-funded.md

11 KiB
Raw Permalink Blame History

2026-08-22 (sera) — Seconda ondata: XS01 fuori dalla sua finestra, e il canale funded ridimensionato di 5x

Branch: research/wave-0822 · 9 filoni · 0 candidati promossi · libro, pesi, cron, config INVARIATI.

Registro per filone: docs/research/RESULTS-0822.md (sezioni 21-29). Briefing: BRIEF-0822.md.


Perche' una seconda ondata

La prima (20 filoni) si era chiusa con un risultato di testa — PROP-ALLOC: su un conto funded riallocare per la barriera di drawdown invece che per lo Sharpe porta J da 0,335 a 0,738, con P(≥50 €/g) da €600 in 36 mesi = 42%. Il percorso piu' veloce mai misurato in questo progetto.

E si era chiusa con l'agente che dichiarava contro se stesso il proprio limite: "tutto il vantaggio poggia sul drift di XS01 misurato sulla sua finestra di scoperta", con un gate che era un'attesa di anni ("non aprire un funded prima che XS01 abbia una finestra fuori dal 2024-2026").

La seconda ondata e' stata mirata su quello, piu' sui falsificatori che gli agenti stessi avevano nominato senza poterli eseguire.


1. XS01 regge fuori dalla sua finestra — ed e' piu' forte li' (§21)

La finestra esisteva gia': gli stessi 19 ticker su Binance spot 2021-01 → 2023-12, che contiene LUNA e FTX. Meccanismo congelato, nessuna griglia cercata.

Mediana di fase +1,12 fuori campione contro +0,37 nella finestra di scoperta; differenza appaiata +0,668, positiva in 10/10 fasi, p=0,013 contro permutazione a fee zero, sopravvive a 30 bps/lato.

L'obiezione ovvia — "Binance non e' la verita'" — e' stata misurata invece che aggirata: quella regola riguarda l'ancoraggio di prezzo, non un ranking cross-sezionale, e lo scarto USDT e' un fattore comune che sparisce nello z-score. Lo stesso sleeve sui due venue da' corr 0,9991.

Null "universo dove non dovrebbe funzionare" (11 settoriali SPDR, 1998+, meccanismo congelato): 0,45, 0/10 fasi positiveterza conferma indipendente che il cross-sectional e' crypto-specifico.

2. Il falsificatore che l'autore ha nominato contro se stesso — eseguito, e non falsifica (§28)

La validazione di venue di §21 girava solo sul 2024+, cioe' senza il depeg USDT che il fuori campione contiene. Soglia dichiarata da lui: corr ≥ 0,99.

Corr mediana 0,9992, minima 0,9921. dSharpe appaiato 0,000. Il titolo passa da +1,12 a +1,11. Guardando il canale del danno — i ribilanciamenti — su 734 solo 10 cambiano una gamba su cinque, e zero dentro la finestra del depeg.

Il punto di metodo: la divergenza va scomposta, perche' le due componenti sono domande diverse. La comune arriva a 39 bps nel depeg ed e' quella che lo z-score annulla; la idiosincratica — l'unica che cambia il ranking — sale solo da 2,0 a 3,6 bps mediani. Riportare solo la prima avrebbe dato la risposta rassicurante e sbagliata.

E ha trovato che il caso peggiore del campione non e' il depeg: e' il 2025-10-10 (cascata di liquidazioni sulle /USDT, INJ a 1.981 bps mentre BTC/ETH stanno a 21). Il meccanismo temuto e' REALE; e' semplicemente caduto nella finestra di scoperta, non nel fuori campione.

3. Ma il numero funded si ridimensiona di 5x — e il colpevole non e' la finestra (§29)

Decomposizione a un grado di liberta' per volta:

passo J Δ
il pubblicato (HL, 19 gambe, finestra di scoperta) 0,739
→ venue Binance, date allineate 0,732 0,006
13 gambe 0,426 0,307
→ pannello lungo 0,459 +0,034
fuori campione 2021-2023 0,520 +0,061

Il 42% del numero pubblicato sta nelle 6 gambe che fuori campione non esistono (ARB OP SUI APT SEI TIA) — e quelle 6 entrarono nell'universo nel 2026-06 guardando la liquidita' HL del 2024+, cioe' dentro la finestra di scoperta. La finestra, da sola, migliora. Allargare l'universo man mano che le gambe nascono non recupera nulla.

Il numero operativo: P(≥50 €/g) da €600 in 36 mesi = 7,8% [7,29,1%], P(zero) 25,5% — contro il 42% pubblicato stamattina. Il peso 0,50 non sopravvive; la regione [25%, 38%] e' entro il 3% dell'ottimo su tutte e tre le finestre.

GATE PROP-01 sostituisce l'attesa di anni: (a) leggere il listino della firm — ≥10 delle 13 gambe shortabili, verifica a €0 e bloccante prima di ogni spesa, stessa classe dell'errore GTAA01/PRIIPs; (b) banda d'ancora di SKH01 sotto la lente prop, 2026-10-31, PASS se > +0,05; (c) un'eval HYRO $100k costa $579 su un conto di $635.

4. L'allarme sul peso di TP01 e' falsificato NEL VERSO (§26)

L'agente aveva registrato nel docstring, prima di misurare, che si aspettava di confermarlo. Invece: TP01 ~0,375 e' l'argmax sia sulla finestra che contiene il 2022 sia su quella che non lo contiene, e nel sinistro il libro con meno TP01 fa meglio — TP01 va flat mentre SKH01 si gira short e guadagna. Test dei segni 12/12 (p=0,0005), 8/8 sul solo pre-2024.

Null del de-levering, 7a occorrenza, in veste nuova ("protezione dal crash"): a leva comune TP01 protegge davvero, ma a iso-sopravvivenza meno TP01 paga di piu' (payout $4.490 → $2.119, monotono).

Tre cose che valgono piu' dell'allarme rimosso:

  • "2024-2026 non contiene un crash" e' falsa nella forma: ha buy&hold a 60% di DD. Manca la taglia (~2,3x sulla coda). La domanda giusta e' "e se ne arriva uno due volte piu' grande".
  • Alle leve funded il 2022 non era una minaccia (min equity 1,4/2,4% contro barriera 6%): cio' che uccide un conto a barriera e' la regola a un giorno su una giornata qualunque.
  • Il rischio vero dell'ottimo e' XS01, non TP01 — e l'agente ha demolito la propria ipotesi contraria dentro la sessione.

5. Tre filoni chiusi con margine

BOCPD (§23) — l'orizzonte adattivo e' CHIUSO DEFINITIVAMENTE. Il falsificatore e' stato eseguito con i rilevatori che nominava (Adams & MacKay + optimal partitioning causale) e questa volta ha avuto potenza: 68/96 celle davvero adattive, contro 0 del primo tentativo. Con potenza, 0/68 su entrambe le condizioni. La decomposizione e' il risultato: l'adattivita' spiega il 7% del vantaggio su TP01 (+0,326 del miglior lookback costante contro +0,305 dell'adattivo). Il 100% e' "un orizzonte piu' corto", non "adattarlo".

MAKER (§22) — il segno dipende da < contro <=. Il passivo vince sul 92-98% degli ordini e perde sulla media (5 ordini su 1535 fanno il 42% del danno). Forma speculare del profit-take di VRP01. Tetto $2,96/anno a $635 nel caso impossibile.

SURFACE-RV (§27) — chiuso, e il meccanismo vale piu' del verdetto. Censimento su 1,24 M quote: 0 violazioni di monotonia su 1,1 M, 1 di convessita' su 1,03 M che vale $0,00. E |residuo| cresce monotonamente col largo del mercatol'incoerenza al mid e' la larghezza del mercato guardata attraverso il mid. Questo uccide il controfattuale USDC che l'agente stesso aveva costruito.

6. BIN-FREQ: la direzione e' reale, la taglia e' selezione (§25)

Argmax +0,112 in 23/23 ancore, ma mediana di famiglia +0,007 con 39/72 celle positive = monetina. L'argmax vale 16x la mediana: punta, non plateau. Direzione solidissima (0/72 sul segno inverso, trasferisce a SKH01_V1).

Due premesse del mio briefing, misurate e refutate: "dimezza gli ordini" → i nettati calano del 17% e i sotto-min-order sono di TP01; "converti il risparmio di fee"a fee zero l'effetto resta l'87-110%, quindi non e' risparmio di costo ma informazione sul rendimento lordo. E la domanda che avevo posto era il confronto sbagliato (la banda del livello si cancella in un disegno appaiato) — ma la risposta corretta e' peggiore, non migliore, per il candidato.

Riapertura pre-registrata: non una data, una soglia di CAPITALE ($5.600 / $53.000), perche' cio' che fallisce e' il rapporto fra un costo fisso e un beneficio proporzionale.

7. Il critico: i difetti stanno nella CUCITURA, non nei filoni (§24)

Una regola mia, pubblicata la sera stessa e ritirata poche ore dopo: avevo scritto che dealer_net_gamma e' "il GEX col segno invertito". Falso, e la fonte gira su questa stessa VPS (cerbero-mcp/.../common/options.py:11-14 dichiara la convenzione). Verificato in due comandi. La correlazione a 0,95 era esattamente cio' che una convenzione diversa deve produrre.

E il difetto piu' grande dell'ondata: il deflated-Sharpe misurato ai suoi due estremi degeneri lo stesso giorno da agenti che non si citano — e tre gate pre-registrati ci poggiano sopra.


Il filo che tiene insieme la giornata: deflated_sharpe non ha una regione utile in mezzo

Tre agenti indipendenti, tre strade diverse, stessa conclusione.

altlib.deflated_sharpe calcola sr0 = sd(Sharpe dei trial) × mult(N): dipende dalla varianza della griglia, non solo da N.

  • VOL-SIZE (ondata 1) lo dichiara VACUO: 1,000 anche per il baseline.
  • BOCPD lo misura dall'altro capo: 0,998 PASS dentro la famiglia omogenea → 0,555 FAIL con l'sr0 di screen. "Gonfiare N col padding alza N e non la varianza."
  • CRITICO trova che l'1,572 di ORTHO-SCREEN implica sd≈0,58, e che le stesse 168 celle dichiarate come 7 famiglie da 24 danno 1,15 — sotto il soffitto ~1,3: il verdetto "impossibile per aritmetica" si ribalta senza toccare un dato, e la cura che suggerisce e' la manovra che il progetto ha proibito il 30/07.
  • BIN-FREQ chiude il cerchio dall'alto: su una famiglia binaria il DSR riacquista potenza (0,977 contro baseline 0,834) perche' le celle scartano insiemi di trade molto diversi. Non e' il candidato a essere piu' solido: e' la famiglia a essere piu' larga.

Non basta contare i trial di screen: serve la VARIANZA di screen. E il numero di trial dichiarati resta una scelta dell'autore, cioe' l'unico posto dove barare e' indolore e invisibile — con in piu' il fatto che ora sappiamo che la stessa griglia da' verdetti opposti a seconda di come la si partiziona.


Cosa NON e' stato fatto, e perche'

Nessuna riparazione applicata. Il cron esegue dalla working tree, che e' su questo branch: una riparazione andrebbe live alle 00:30 senza una decisione dell'operatore. Il diff tocca solo scripts/research/, docs/ e CLAUDE.md (verificato).

Restano dell'operatore: (1) riparare advance() + rigenerare i monitor forward prima del gate STATARB del 27/09; (2) decidere del branch; (3) la verifica a costo zero che decide il canale funded — leggere il listino di una prop firm.

📌 E la risposta onesta al mandato, che al critico era stato chiesto di dare se vera: nessuna misura di ricerca di questa giornata batte "versare". L'effetto piu' grande misurato oggi vale €0,0113/giorno; versare €500/mese vale ~1456x quello. La ricerca ha smesso di essere il vincolo binding il 26/07, e due ondate da 29 filoni lo hanno confermato invece che ribaltarlo.