Wat is inference?
Inference is het moment waarop een getraind model daadwerkelijk een antwoord berekent. Trainen gebeurt één keer en kost maanden rekenkracht; inference gebeurt bij elke vraag opnieuw en bepaalt wat het gebruik je kost.
Vandaar dat aanbieders per token afrekenen en dat een lange context duurder uitvalt.