Limite de requêtes : le mur invisible des automatisations

La limite de requêtes est le nombre maximum d'appels qu'un service accepte sur une période donnée.
3 min de lecture
Believemy logo

C'est la cause numéro un des automatisations qui fonctionnent parfaitement en test et échouent en production. Rien n'a changé dans votre scénario : c'est le volume qui a franchi un seuil dont personne ne parlait.


Définition

La limite de requêtes, souvent appelée rate limit, est le nombre maximum d'appels qu'un service accepte sur une période donnée. Au-delà, il refuse les appels suivants.

Elle s'exprime de plusieurs façons selon les services : par seconde, par minute, par jour, parfois en volume de données ou en Token plutôt qu'en nombre d'appels.

Bon à savoir

Le refus n'est pas une panne, c'est une réponse normale du service qui vous demande de ralentir. Le problème vient de ce que votre automatisation en fait : si elle ignore ce refus, elle perd les éléments concernés sans le dire.


Les trois façons de se faire refuser

La rafale

Mille éléments arrivent d'un coup, votre Workflow lance mille appels en dix secondes. Le service en accepte cent et refuse le reste. C'est le cas le plus fréquent, et le Traitement par lot le règle.

Le cumul silencieux

Trois automatisations différentes appellent le même service. Chacune reste sous la limite, leur somme non. Personne ne l'avait prévu parce que personne ne regardait l'ensemble.

La montée en charge

Votre volume double sans que rien d'autre ne change. Le seuil qui n'était jamais atteint le devient un mardi matin, en général le jour où vous n'êtes pas devant.


Comment s'en protéger

Lisez la limite avant de construire. Elle figure dans la documentation de l'API. Deux minutes de lecture évitent une refonte.

Espacez volontairement. Une pause d'une seconde entre deux appels suffit presque toujours, et ne coûte rien sur un traitement nocturne.

Réessayez intelligemment. En cas de refus, attendez puis réessayez, en doublant l'attente à chaque échec. Réessayer immédiatement aggrave la situation.

Surveillez le taux de refus. Un service qui commence à refuser 1 % des appels vous prévient plusieurs semaines avant de refuser la moitié.

Attention

Le pire scénario n'est pas l'échec bruyant, c'est l'échec partiel silencieux : trois cents éléments traités, sept cents refusés, et un statut affiché comme terminé. Comparez toujours le nombre d'éléments traités au nombre reçu.


Questions fréquentes

Question

Peut-on augmenter sa limite ?

Souvent, oui, en passant à une formule supérieure ou en la demandant au support. Les fournisseurs d'IA relèvent en général les limites au fil de votre historique de consommation.


Question

Comment savoir où j'en suis ?

La plupart des services renvoient l'état de votre quota dans les en-têtes de leurs réponses. C'est une information utilisable pour ralentir automatiquement avant d'atteindre le mur.


Question

Les modèles d'IA ont-ils les mêmes limites ?

Ils en ont deux : un nombre d'appels par minute et un volume de jetons par minute. La seconde se heurte souvent en premier quand vos consignes sont longues, ce qui surprend puisque le nombre d'appels reste bas.


Question

Comment dimensionner une automatisation dès le départ ?

En posant la question du volume maximum au moment d'écrire le Scénario d'automatisation. Notre formation n8n traite ce dimensionnement avant la construction, pas après la première panne.

Termes connexes

Découvrez notre glossaire IA et automatisation

Le vocabulaire de l'intelligence artificielle et de l'automatisation, expliqué pour ceux qui veulent s'en servir dans leur activité, pas pour ceux qui construisent les modèles.

Partager cet article

Tu veux nous aider ? Fais un lien vers cet article sur tes réseaux ou encore mieux : sur ton site, dans un article ou dans ta newsletter.