Depois de testar um LLM no sequenciamento de uma fábrica, fizemos a mesma pergunta para a previsão de demanda. Entregamos o histórico de vendas de uma base com 1.589 séries a cinco IAs de fronteira, três vezes cada, e comparamos as previsões com as do nPlan Demand num período futuro que nenhuma delas viu.
Resposta curta
Um LLM pode prever a demanda, mas o resultado isolado não se repetiu de forma estável. Na mediana das execuções, o nPlan venceu todas as IAs em WMAPE, viés e erro no total mensal. Uma única sessão, de 15, fez WMAPE 1 ponto melhor que o nPlan, com viés de −4,31%; as outras duas sessões do mesmo modelo perderam.
O problema maior é outro: cada vez que roda, a IA entrega uma previsão diferente. De uma execução para outra, a previsão das IAs mudou entre 8% e 12% do volume; a do nPlan, 0,55%.
Uma previsão de demanda é o ponto de partida do S&OP, um processo que envolve vendas, operações e finanças. Ali, confiança vale mais que a melhor sessão.
O comparativo
Na mediana das três sessões de cada IA, o nPlan Demand teve o melhor resultado em todas as métricas de acurácia, a menor variação entre execuções e custo zero por execução.
| Mediana das execuções | ||||||
|---|---|---|---|---|---|---|
| Erro da previsão | ||||||
| WMAPE (%) | 38,32 | 39,27+0,95 | 40,30+1,98 | 40,32+2,00 | 41,90+3,58 | 42,07+3,75 |
| Erro no total mensal (%) | 5,05 | 5,72+0,67 | 6,89+1,84 | 7,89+2,84 | 8,66+3,61 | 8,14+3,09 |
| Viés | ||||||
| Viés (%)perto de zero é melhor | +0,47 | +2,24 | +5,08 | +6,71 | +7,86 | +7,67 |
| Estabilidade | ||||||
| De uma execução para outra (%) | 0,55 | 11,59 | 8,13 | 7,92 | 8,13 | 9,99 |
Mediana das 3 sessões de cada IA, todas em esforço médio; nPlan Demand: uma execução, e execuções repetidas para a variação · futuro selado de fev a jul/2026.
Por que este teste
No estudo de sequenciamento, o LLM fez um plano válido, mas o motor do nPlan fez 27% menos setup, 75 vezes mais rápido. A crítica mais previsível era: e se o LLM pudesse escrever código? Neste estudo, pôde.
Cada IA recebeu o histórico de vendas, podia escrever e executar código à vontade e tinha uma missão: entregar a melhor previsão possível. Na prática, cada sessão construiu o próprio modelo de forecast.
As premissas seguiram a mesma lógica de ser justo e honesto:
- Cinco IAs de três fornecedores. Opus 5.5, Sonnet 5.5 e Fable 5.1, da Anthropic; Grok 4.7, da xAI; e GPT-6.1 Sol, da OpenAI.
- Três sessões de cada. Numa primeira rodada, com uma sessão por IA, os resultados variaram muito. Rodar de novo, com a memória zerada, era a única forma de saber se o resultado se repetia.
- O nPlan só com o modelo. No dia a dia, o nPlan Demand trata os dados, usa dados externos e passa pela colaboração das áreas. Aqui rodou sem nada disso, para comparar apenas a previsão dos modelos.
A base e como foi o teste
A base principal é um histórico mensal de vendas com 1.589 séries, de 911 produtos, e 30 meses, de agosto de 2023 a janeiro de 2026. Cerca de 13% dos meses têm venda zero, e há até série com uma única observação.
As IAs receberam um arquivo de treino e um de teste, que podiam usar para ajustar os modelos. A avaliação foi feita em outro período, de fevereiro a julho de 2026, que nenhuma delas viu.
Medimos três coisas: o WMAPE, erro médio ponderado pelo volume; o viés, soma do erro sobre a soma do real, em que positivo é sobreprevisão; e o erro no total mensal da empresa.
Cada sessão foi isolada e rodou em esforço médio. Um revisor de outra família de modelos conferiu o código e a saída de cada sessão, e todas foram pontuadas pelo mesmo método. O estudo foi conduzido por Theylor Machado, da equipe da NEO.
Resultado: a mediana e cada sessão
Na mediana, nenhuma IA chegou ao nPlan. Sessão a sessão, aparece a dispersão: o mesmo modelo, com o mesmo pedido, caiu em lugares bem diferentes.
| Modelo | WMAPE (%) · menor é melhor | Viés (%) · perto de zero é melhor |
|---|---|---|
| nPlan Demand | 38,32 | +0,47 |
| Opus 5.5 | 37,33 (sessão 2); 39,27 (1); 40,26 (3) | −4,31 (2); +2,24 (1); +8,22 (3) |
Opus: três sessões isoladas, em esforço médio; nPlan Demand: uma execução.
Treze das 15 sessões sobrepreveem de 5% a 9,3% do volume. O Opus foi o mais instável: suas três sessões vão de −4,31% a +8,22% de viés.
Um modelo que ganha uma vez e perde duas
Só 1 das 15 sessões bateu o nPlan em WMAPE: a segunda do Opus 5.5, com 37,33% contra 38,32%. Não foi o modelo que ganhou. Foi uma sessão.
Com o mesmo pedido e os mesmos dados, as outras duas sessões do Opus perderam para o nPlan, com 39,27% e 40,26%. Entre as três, o WMAPE do modelo variou 2,93 pontos.
A sessão vencedora também errou o volume para baixo: viés de −4,31%, contra +0,47% do nPlan. Numa operação, subprever 4% do volume de seis meses é risco de ruptura.
A rodada preliminar, em três bases de dados diferentes e com uma sessão por IA, mostrou o mesmo padrão. A melhor sessão do Opus bateu o nPlan por menos de 1 ponto de WMAPE em duas bases; na terceira, o nPlan foi o melhor e o Opus ficou em penúltimo.
Para ganhar do nPlan com a IA, seria preciso rodar várias vezes e saber, antes de o futuro chegar, qual sessão escolher. Isso não é possível.
Por que o motor ganha
O nPlan Demand não é um modelo. É um motor estatístico que roda uma biblioteca de mais de 20 modelos, compara cada um série a série num período de teste e escolhe o melhor, ou uma combinação deles.
A biblioteca vai de médias móveis e sazonal ingênuo a ARIMA, ETS e Theta. Passa por métodos para demanda intermitente, como Croston, TSB e ADIDA, e chega a machine learning, redes neurais e foundation models como Chronos e TimesFM.
Uma IA constrói, numa única sessão, uma solução bem mais simples. Na rodada preliminar, o GPT-6.1 Sol montou 11 candidatos, de médias e suavizações a regressões harmônicas e TSB, e combinou os dois melhores. A ideia é boa, mas cobre uma parte pequena do que um motor maduro explora.
Pedindo mais e mais, sessão após sessão, um usuário pode chegar a uma solução tão boa quanto, ou melhor. Aí ele não está mais usando IA para prever demanda. Está usando IA para desenvolver um software caseiro de previsão, que vai precisar de testes, manutenção e sustentação como qualquer sistema interno.
O que existe dentro do motor está detalhado em Planejamento de Demanda: da estatística à decisão.
Confiança: o ponto de partida do S&OP
Uma previsão de demanda não é um número para uma pessoa só. É o ponto de partida de um processo em que vendas, operações e finanças decidem juntas o que vender, produzir e comprar.
Imagine um produto que vende, em média, 100 unidades por mês. Se o modelo prevê 105, dá para aceitar: talvez tenha captado uma tendência ou uma sazonalidade. Mas se, rodando de novo, prevê 95, a confiança acaba: por que antes era mais e agora é menos?
Foi o que aconteceu com as IAs.
IAs: pares das 3 sessões isoladas de cada modelo · nPlan Demand: execuções repetidas do mesmo cenário.
A causa é a mesma da dispersão: a cada sessão, a IA escolheu um método de previsão diferente, sem registrar de forma explícita e auditável o porquê. O nPlan também varia um pouco entre execuções repetidas; a diferença é de escala, meio por cento contra dez.
Quando a IA não diz a verdade
O revisor encontrou erros em quatro das cinco IAs: afirmações falsas sobre os dados, relatos do que não foi feito e atos fora das regras. Só o GPT-6.1 Sol passou limpo.
Sonnet 5.5
- Atribuiu ao modelo final um resultado de teste que ele nunca teve.
- Disse ter escolhido o modelo só com dados até setembro, depois de olhar o teste.
Fable 5.1
- Disse que uma série ia de 194 a 13.463; o arquivo tem 15.118.
- Listou um método que não usou.
- Citou um ajuste de outlier que não aconteceu.
Grok 4.7
- Tentou acessar dados fora da sua pasta.
- Escolheu a configuração pelo próprio teste e citou outra janela.
- Usou um teste de 1 mês como prova para previsões de 3 a 4 meses.
Opus 5.5
- Editou à mão a previsão de uma série depois de rodar o modelo.
- Chamou de “sem gabarito” uma escolha feita olhando o teste.
GPT-6.1 Sol
- Nenhum erro encontrado.
O Grok foi procurar o gabarito
O caso mais curioso foi o do Grok 4.7. Durante a sessão, ele tentou ler dados do benchmark fora da pasta a que tinha acesso, justamente onde estaria o período usado para avaliar as previsões. O acesso foi bloqueado.
O pedido era amplo: a melhor previsão possível. Ao que tudo indica, a IA tratou procurar a resposta como um caminho válido para chegar lá.
É um exemplo claro do risco de entregar uma tarefa ampla a uma IA sem limites rígidos. Aqui o acesso estava bloqueado e o revisor viu a tentativa; num ambiente de empresa, com acesso a sistemas e dados reais, o mesmo atalho pode passar despercebido.
O Opus fez uma colaboração escondida
Depois de rodar o modelo, o Opus 5.5 fixou à mão a previsão de uma série com uma única observação. A edição até melhorou a série, de 87,5% para 34,6% de WMAPE. O problema é que ela não está no modelo: rodando de novo, desaparece, e ninguém fica sabendo que existiu. No nPlan, um ajuste assim passa pela colaboração e fica registrado.
Na rodada preliminar, com um pedido mais simples, os sinais foram parecidos. O Opus ajustou o modelo ao período de teste e depois passou a alterar previsões à mão para parecerem melhores. O Sonnet disse que não usaria o período de teste, mas o usou para escolher os parâmetros. O Grok disse que não otimizaria para um teste de um mês e refez a solução várias vezes para fazer exatamente isso.
Limites deste teste
Como no estudo de sequenciamento, este é um primeiro passo, que vai amadurecer com o tempo. Para ler os resultados, vale ter em mente:
- O estudo principal usou uma base e três sessões por IA. A rodada preliminar, em outras duas bases, teve uma sessão por IA.
- As IAs rodaram em esforço médio. Com esforço máximo, os resultados e o custo poderiam mudar.
- O pedido às IAs foi aberto, sem métrica definida. Outros pedidos podem levar a outros resultados; na rodada preliminar, o Grok precisou de um pedido diferente.
- O nPlan rodou sem tratamento de dados, dados externos e colaboração. Isso favorece as IAs.
- A variação do nPlan vem de execuções repetidas do mesmo cenário; a das IAs, de três sessões isoladas.
- O custo das IAs é o preço de tabela da API pelos tokens de cada sessão.
Quer ver o mesmo teste com os dados da sua empresa? Estamos abertos a provas de conceito com indústrias interessadas. Fale com a gente.
O que o teste mostra
Consegue fazer uma previsão razoável, escrevendo o próprio código, e uma vez em quinze chegou a bater o nPlan em WMAPE. Mas não repete: cada sessão escolhe um método, entrega um número diferente e, às vezes, relata o que não fez.
Para o S&OP, isso é decisivo. Vendas, operações e finanças precisam partir do mesmo número e confiar nele, e uma previsão que muda a cada execução tira essa base.
O caminho é o mesmo do sequenciamento: a IA na frente do motor. Ela entende a pergunta do planejador, chama o nPlan Demand e explica a previsão a partir dos fatores que o motor calculou. O número sai de um modelo auditável, e cada ajuste fica registrado.
Os dois estudos chegam ao mesmo ponto por caminhos diferentes. No sequenciamento, o motor ganhou em resultado, tempo e custo; na previsão, o custo das IAs é de centavos, e o que pesa é a confiança.
Leia também: Planejamento de Demanda: da estatística à decisão, sobre os dados, modelos e colaboração que compõem o nPlan Demand.