Quanto custa rodar um LLM local? Medição real no Apple Silicon
O senso comum diz que rodar LLMs no seu próprio hardware é grátis — você já comprou a máquina, a eletricidade é troco, e cada token gerado é lucro. Mas um experimento recente publicado no Towards Data Science, usando um Mac Studio com M3 Ultra e 96 GB de memória unificada, coloca números reais nessa conta — e os resultados surpreendem.
O autor Justin Stewart construiu uma ferramenta chamada TokenWatt, um proxy compatível com OpenAI feito sob medida para Apple Silicon. O TokenWatt mede o consumo de energia do SoC inteiro usando os contadores da Apple (os mesmos que alimentam a aba de energia do Monitor de Atividade) e foi calibrado com um medidor físico na tomada (Shelly Plug US Gen4), com margem de erro entre ±2,6% e ±4,5%.
Os cinco modelos testados
Os modelos foram executados em loop contínuo de geração por 2, 6 e 12 minutos, três vezes cada, com 15 minutos de intervalo para medir o consumo ocioso. O custo da eletricidade foi fixado em US$ 0,31/kWh. Eis os resultados por milhão de tokens gerados:
| Modelo | Parâmetros | Tipo | Memória | tok/s | US$/1M tokens |
|---|---|---|---|---|---|
| Qwen3.5-4B | 4B | Denso | 2,9 GB | 133,8 | US$ 0,063 |
| Qwen3.6-35B-A3B | 35B | MoE (3B) | 35 GB | 76,0 | US$ 0,087 |
| Qwen3-Coder-Next | ~80B | MoE (3B) | 60 GB | 65,0 | US$ 0,103 |
| gpt-oss-120b | 120B | MoE (5B) | 59 GB | 74,0 | US$ 0,109 |
| Qwen3.6-27B | 27B | Denso | 28 GB | 21,5 | US$ 0,554 |
A surpresa: maior nem sempre é mais caro
O modelo mais caro da lista é o Qwen3.6-27B — um modelo denso de 27 bilhões de parâmetros que custa 5 a 9 vezes mais por token do que modelos maiores. O modelo de 120B (gpt-oss-120b, MoE com 5B ativos) é cinco vezes mais barato que o de 27B.
O motivo é simples: o custo de eletricidade por token é watts dividido por throughput. Modelos Mixture-of-Experts (MoE) ativam apenas uma fração dos parâmetros por token, gerando muito mais tokens por segundo com consumo de energia similar. Já modelos densos grandes saturam a GPU com menos throughput.
O que isso significa na prática
Para quem roda LLMs localmente no Brasil — especialmente em hardware Apple Silicon (MacBook Pro, Mac Studio) — a lição é clara: escolha arquiteturas MoE sempre que possível. Um modelo de 120B com 5B ativos pode ser mais barato de operar do que um modelo denso de 27B, mesmo custando mais em memória.
O TokenWatt está disponível como open source no GitHub (github.com/mmmugh/tokenwatt) e funciona com qualquer servidor de inferência compatível com OpenAI rodando em Apple Silicon. Basta apontar o proxy para o seu servidor local e ele mede o custo real de cada requisição.
Considerando a tarifa média brasileira de energia (cerca de R$ 0,70/kWh residencial), rodar o modelo mais barato (Qwen3.5-4B) custa aproximadamente R$ 0,14 por milhão de tokens. Para comparação, a API do GPT-4o mini custa US$ 0,15 por milhão de tokens de saída — ou seja, rodar localmente pode ser competitivo dependendo do modelo e do volume de uso.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



