Por qué tu backtest miente
Analizamos 17 robots que brillaban en el papel. Ninguno con edge real sobrevivió a los ticks del mercado. Con datos, no opiniones.
La trampa que arruina cuentas
Casi todos los robots (EAs) que se compran y venden llegan con un backtest espectacular: factor de beneficio alto, curva de equity impecable. El truco es que ese backtest usa un modelo de ticks sintético —precios generados por el simulador— y no la realidad del mercado: spreads reales, slippage y la microestructura de cada tick.
La consecuencia: un robot puede lucir un Profit Factor de 1,68 en el simulador y perder dinero con ejecución real. No es teoría. Lo hemos medido, robot a robot, con ticks reales del bróker.
La prueba: simulador contra ticks reales
Sometimos a un doble juez —supervivencia en ticks reales frente al backtest sintético— a una familia de 17 robots (variantes de la misma idea sobre oro: entrada por order-block más filtro de tendencia). En el simulador varios parecían oro puro. En ticks reales, la verdad (muestra representativa):
| Robot | PF simulador | PF real | Neto real (1.000 $) |
|---|---|---|---|
| PHALANX | 1,68 | 0,74 | −878 $ |
| TITAN | 1,46 | 0,84 | −571 $ |
| IRON DOME | 1,40 | 0,89 | −395 $ |
| ADAPTIVE | 1,33 | 0,78 | −820 $ |
| VANGUARD | 1,25 | 0,74 | −196 $ |
| GHOST PROTOCOL 2 | 1,01 | 0,68 | −775 $ |
| V3.1 «Golden Phalanx» | 1,01 | 0,38 | −959 $ |
| V3 «Oracle of Delphi» | 0,95 | 0,50 | −857 $ |
El patrón es uniforme y demoledor: el espejismo sintético se desploma contra los fills reales. Y ojo: los dos «favoritos» con filtro horario Kill Zone (Golden Phalanx y Oracle of Delphi) fueron de los peores en real —PF 0,38 y 0,50, probabilidad de ruina cercana al 100%—. Un filtro bonito no salva una lógica sin edge.
Cómo se valida de verdad (los cuatro filtros que casi nadie aplica)
- Supervivencia en ticks reales: el mismo robot en ticks reales frente a sintéticos. Si el resultado cambia, era un espejismo.
- Monte Carlo de cola: probabilidad de ruina con la cola exacta derivada de la lógica del robot, no una media optimista.
- Walk-forward: ¿el edge aguanta en ventanas de tiempo que el robot no vio al ajustarse?
- Meseta (sensibilidad): se perturban los parámetros ±15%. Si un solo ajuste lo rompe, era sobreajuste disfrazado.
Para contraste, un robot criado y filtrado con este proceso: PF fuera de muestra 1,31 · supervivencia en ticks reales 99,8% · probabilidad de ruina 0% · meseta 6/6 variantes sanas. La diferencia con la tabla de arriba no es suerte: es el método.
Conclusión
No te fíes de un backtest bonito. Antes de poner un euro real en un robot —tuyo o comprado—, la pregunta correcta es: ¿sobrevive a ticks reales, a su cola de riesgo y a perturbar sus parámetros? Si no lo has medido, no lo sabes.