
Estudos
28 de jul. de 2026
Ollama Truncation Loop — ou: como 4096 tokens de contexto me fizeram perder 2h de debug
O Hermes entrava em loop de continuation 4x seguidas antes de desistir. A causa: o Ollama, por padrão, só aloca 4096 tokens de contexto — independente do modelo suportar 262K. Aprendi na marra que num_ctx do modelo ≠ num_ctx do slot.
Continuar lendo →