C'est la cause numéro un des automatisations qui fonctionnent parfaitement en test et échouent en production. Rien n'a changé dans votre scénario : c'est le volume qui a franchi un seuil dont personne ne parlait.
Définition
La limite de requêtes, souvent appelée rate limit, est le nombre maximum d'appels qu'un service accepte sur une période donnée. Au-delà, il refuse les appels suivants.
Elle s'exprime de plusieurs façons selon les services : par seconde, par minute, par jour, parfois en volume de données ou en Token plutôt qu'en nombre d'appels.
Le refus n'est pas une panne, c'est une réponse normale du service qui vous demande de ralentir. Le problème vient de ce que votre automatisation en fait : si elle ignore ce refus, elle perd les éléments concernés sans le dire.
Les trois façons de se faire refuser
La rafale
Mille éléments arrivent d'un coup, votre Workflow lance mille appels en dix secondes. Le service en accepte cent et refuse le reste. C'est le cas le plus fréquent, et le Traitement par lot le règle.
Le cumul silencieux
Trois automatisations différentes appellent le même service. Chacune reste sous la limite, leur somme non. Personne ne l'avait prévu parce que personne ne regardait l'ensemble.
La montée en charge
Votre volume double sans que rien d'autre ne change. Le seuil qui n'était jamais atteint le devient un mardi matin, en général le jour où vous n'êtes pas devant.
Comment s'en protéger
Lisez la limite avant de construire. Elle figure dans la documentation de l'API. Deux minutes de lecture évitent une refonte.
Espacez volontairement. Une pause d'une seconde entre deux appels suffit presque toujours, et ne coûte rien sur un traitement nocturne.
Réessayez intelligemment. En cas de refus, attendez puis réessayez, en doublant l'attente à chaque échec. Réessayer immédiatement aggrave la situation.
Surveillez le taux de refus. Un service qui commence à refuser 1 % des appels vous prévient plusieurs semaines avant de refuser la moitié.
Le pire scénario n'est pas l'échec bruyant, c'est l'échec partiel silencieux : trois cents éléments traités, sept cents refusés, et un statut affiché comme terminé. Comparez toujours le nombre d'éléments traités au nombre reçu.
Questions fréquentes
Peut-on augmenter sa limite ?
Souvent, oui, en passant à une formule supérieure ou en la demandant au support. Les fournisseurs d'IA relèvent en général les limites au fil de votre historique de consommation.
Comment savoir où j'en suis ?
La plupart des services renvoient l'état de votre quota dans les en-têtes de leurs réponses. C'est une information utilisable pour ralentir automatiquement avant d'atteindre le mur.
Les modèles d'IA ont-ils les mêmes limites ?
Ils en ont deux : un nombre d'appels par minute et un volume de jetons par minute. La seconde se heurte souvent en premier quand vos consignes sont longues, ce qui surprend puisque le nombre d'appels reste bas.
Comment dimensionner une automatisation dès le départ ?
En posant la question du volume maximum au moment d'écrire le Scénario d'automatisation. Notre formation n8n traite ce dimensionnement avant la construction, pas après la première panne.