Metodologia Scientifica, Elaborazione Dati & Protocolli Anti-Overfitting
La validità delle scoperte finanziarie ed econometriche dipende interamente dal rigore del protocollo sperimentale. Questo documento descrive l'infrastruttura analitica di Neural Trade: dalla pulizia microscopica dei dati ad alta frequenza al campionamento informativo in Dollar Bars, dalla Differenziazione Frazionaria al Purged K-Fold Cross-Validation e ai test stocastici DSR e PBO.
1. Ingestion Dati Tick-by-Tick & Pipeline di Bonifica a 5 Fasi
I dati sui prezzi dei mercati finanziari grezzi estratti dai feed istituzionali (FIX Protocol / WebSocket) contengono rumore, anomalie di quotazione (Spikes), tick non eseguiti e micro-strutture spurie. Il laboratorio Neural Trade applica un processo di sanificazione in 5 stadi:
- Filtraggio degli Outlier e Anomalie (Hampel Filter): Identificazione e rimozione dei tick con deviazioni superiori a 3.5 median absolute deviations (MAD) rispetto alla finestra mobile.
- Rimozione del Bid-Ask Bounce (Algoritmo di Lee-Ready): Tracciamento e classificazione delle transazioni tra aggressive buyer e aggressive seller basato sul prezzo d'asta rispetto al midpoint.
- Verifica dell'Integrità Temporale (Nanosecond Timestamping): Sincronizzazione PTP (Precision Time Protocol) per eliminare i problemi di latenza e disordine dei pacchetti di dati.
- Normalizzazione delle Operazioni Societarie (Corporate Actions): Aggiustamento dinamico retroattivo per dividendi azionari, frazionamenti (Stock Split) e aumenti di capitale.
- Ricostruzione dell'Order Book Microstrutturale: Aggregazione della profondità di livello 2 (L2/L3) per stimare la liquidità reale e l'impatto di mercato ($Market Impact$).
2. Paradigmi di Campionamento Informativo: Time Bars vs Dollar Bars
Il campionamento convenzionale basato su intervalli di tempo fissi (Time Bars: 1 minuto, 1 ora, 1 giorno) è intrinsecamente difettoso nella ricerca quantitativa avanzata. Poiché l'attività di mercato non scorre uniformemente con il tempo cronologico ma varia in base ai volumi scambiati, le Time Bars producono serie storiche con **eteroschedasticità pronunciata** e distribuzioni con **kurtosi elevata**.
| Tipo di Campionamento | Criterio di Chiusura della Barra | Proprietà Statistiche delle Serie | Idoneità per Modelli Quant |
|---|---|---|---|
| Time Bars (1 Minuto / 1 Ora) | Intervallo di tempo solare fisso $\Delta t$ | Non normali, eteroschedastiche, instabili | Scarsa (Obsoleto per la ricerca) |
| Tick Bars | Numero fisso $N$ di transazioni executed | Migliore omogeneità della varianza | Discreta |
| Volume Bars | Volume cumulato fisso $V$ di contratti/azioni | Distribuzione più vicina alla gaussiana | Buona |
| Dollar Bars (Raccomandato) | Valore nozionale monetario fisso $W = \sum P_i \cdot V_i$ | Proprietà di stazionarietà e normalità eccellenti | Ottimale (Standard Neural Trade) |
3. Differenziazione Frazionaria ($d \in ]0,1[$) & Preservazione della Memoria
I modelli finanziari tradizionali affrontano il problema della non-stazionarietà dei prezzi applicando la differenziazione intera prima ($d=1$), ovvero calcolando i rendimenti logaritmici. Tuttavia, la differenziazione intera rimuove totalmente la **memoria storica e di lungo termine** del prezzo ($Memory Loss$).
L'approccio di **Differenziazione Frazionaria** consente di applicare un ordine di differenziazione reale $d \in ]0, 1[$ tramite l'espansione della serie binomiale:
Si determina il valore minimo di $d^*$ che rende la serie stazionaria secondo il test di **Augmented Dickey-Fuller (ADF)** con un p-value $< 0.05$, preservando al massimo il contenuto informativo ed il coefficiente di correlazione con i prezzi originali.
4. Validazione Incrociata Avanzata: Purged K-Fold Cross-Validation & Embargo
Nel machine learning tradizionale, la tecnica di K-Fold Cross-Validation assume che le osservazioni siano indipendenti e identicamente distribuite (IID). Nelle serie storiche finanziarie, le etichette delle posizioni ($Labels$) si sovrappongono nell'arco di tempo tra l'ingresso ed la chiusura dello Stop Loss/Take Profit.
L'algoritmo di **Purged K-Fold Cross-Validation con Embargo** (López de Prado) risolve il data leakage:
- Purging (Epurazione): Rimuove dai set di addestramento tutte le osservazioni i cui intervalli di mantenimento si sovrappongono temporaneamente con i dati del set di test.
- Embargo (Quarantena): Aggiunge un intervallo di cuscinetto temporale aggiuntivo subito dopo il set di test per eliminare l'autocorrelazione residua prima di riprendere i dati di training.
5. Prevenzione dell'Overfitting: Deflated Sharpe Ratio (DSR) & PBO
Testare centinaia o migliaia di variazioni di parametri su un singolo dataset storico conduce inesorabilmente alla selezione casuale del rumore anziché di un vero segnale ($Selection Bias$).
Neural Trade applica il **Deflated Sharpe Ratio (DSR)**, che corregge lo Sharpe Ratio stimato per:
- La non-normalità dei rendimenti (Asimmetria e Kurtosi).
- La durata limitata della serie storica.
- Il numero totale di prove e backtest condotti ($N_{trials}$).
Un modello viene ritenuto statisticamente valido e privo di overfitting solo se presenta un valore DSR $> 0.95$ ($95\%$ di confidenza).
6. Domande Frequenti (FAQ) - Metodologia Scientifica
Perché le Time Bars sono inadeguate nella ricerca quantitativa?
Le Time Bars campionano i dati ad intervalli di tempo arbitrari, producendo serie temporali con eteroschedasticità pronunciata, varianza non costante e distribuzioni a code pesanti. I campionamenti basati sui flussi di volume o di capitale (Dollar Bars) ripristinano proprietà vicine alla normalità gaussiana.
Che cos'è la Differenziazione Frazionaria?
È una tecnica matematica che consente di rendere stazionaria una serie storica finanziaria (superando i test Dickey-Fuller) mantenendo al contempo il massimo grado possibile di memoria storica e predittiva dei prezzi originali.
A cosa serve il Purging e l'Embargo nella validazione incrociata?
Servono a rimuovere le sovrapposizioni temporali tra i dati di addestramento e quelli di test nelle serie storiche finanziarie, eliminando il fenomeno del data leakage che causa sopravvalutazioni ingannevoli delle prestazioni di backtest.