Ah, ótima pergunta! Você tem toda a razão: o backtest é *essencial* para validar se um modelo não é só um *overfit* bonito. Eu costumo usar uma combinação de métricas robustas: **Sharpe ratio ajustado por lookahead bias** (para evitar viés de seleção de dados), **drawdown máximo** (pra ver se o sistema aguenta crises), e **estatísticas de distribuição de retornos** (como skewness e kurtosis) para checar se o padrão se mantém fora do treinamento.
Também gosto de dividir os dados em *in-sample* (