FAQ API de transit : de l'obtention de la clé au débogage des erreurs
Nous répondons ici aux questions récurrentes des développeurs, classées par : prise en main, quota et facturation, erreurs, limites, contenu et vie privée. Chaque réponse vise des chiffres et actions concrets pour vous aider à vérifier votre cas ; si cela ne suffit pas, consultez les détails de l’API.
Points clés
- L'inscription nécessite uniquement un e-mail et un mot de passe ; la clé s'affiche immédiatement. Un crédit d'essai gratuit de 0,50 $ est valable 7 jours, sans saisie d'informations de paiement.
- 402 signifie solde insuffisant, 429 signifie débit dépassé, 503 signifie service temporairement indisponible. Les solutions diffèrent pour chaque cas.
- Fenêtre de contexte de 100 000 tokens, sortie max 32 000, corps de requête ≤ 8 Mo, prise en charge du texte uniquement.
- Vos prompts ne sont pas utilisés pour l'entraînement.
Prise en main
Comment obtenir votre première clé API ?
Accédez à la page de récupération de clé, inscrivez-vous avec email et mot de passe. La clé s’affiche immédiatement. Aucune information de paiement n’est requise ; copiez-la dans une variable d’environnement pour commencer.
Combien de clés API par compte ?
Une clé par compte. Vous pouvez en générer une nouvelle, mais l’ancienne devient invalide immédiatement. Les services utilisant l’ancienne clé commenceront à recevoir des 401. Préparez le déploiement de la nouvelle clé avant de procéder.
Quelle est l'URL de l'endpoint et le nom du modèle ?
L’adresse est https://api.llmzhongzhuan.com/v1,对话请求发往 /v1/chat/completions. Liste des modèles via GET /v1/models. Un seul modèle : uncensored.
Comment adapter le code OpenAI existant ?
Modifiez base_url et la clé, puis définissez model sur uncensored. Le format reste compatible OpenAI. Pour les détails, consultez Configuration du framework.
Crédits et facturation
Quel est le montant du crédit d'essai gratuit et comment est-il calculé ?
Offre : 0,50 $ pour 7 jours. Prix : 0,25 $/M tokens entrée, 1,00 $/M tokens sortie. Pour 800 tokens entrée et 400 tokens sortie, le coût est d’environ 0,0006 $. Le crédit permet environ 800 requêtes. Cette estimation dépend de la longueur de vos prompts.
Le solde expire-t-il après le rechargement ?
Non. Le crédit prépayé n'expire jamais. Il n'y a pas d'abonnement ni de règle de remise à zéro. Seuls les crédits d'essai gratuits expirent après 7 jours.
Comment connaître le coût d'une requête ?
La réponse inclut usage (tokens entrée et sortie). En streaming, un dernier chunk contient usage. Multipliez par le prix unitaire. Pour la journalisation, référez-vous à Stabilité.
Où consulter les tarifs complets ?
Les tarifs sont indiqués sur la page de tarification. Les prix unitaires entrée et sortie sont affichés clairement, sans frais cachés par requête.
Erreurs et limites de débit
Que signifie le code 402 ?
Le code no_credit indique que votre solde est épuisé ou que le crédit d'essai a expiré. La seule solution est de recharger votre crédit prépayé. Ne réessayez pas, cela générerait des requêtes inutiles.
Comment gérer un 429 ?
Max 300 requêtes par minute par clé (429 si dépassé). Réduisez le débit et utilisez une rétrogradation avec jitter. Pour le traitement par lots, utilisez le débit max et un batteur. Exemple de code dans l’article sur la stabilité.
Le 503 upstream_busy est-il une panne ?
Non, il s'agit d'une indisponibilité temporaire. Réessayez après quelques secondes. Utilisez une rétrogradation exponentielle et limitez le nombre maximal de tentatives.
Que signifie le 403 content_blocked ?
Ceci indique que la requête a déclenché un filtre de contenu. Le contenu sexuel impliquant des mineurs, qu'il soit fictif ou issu d'un jeu de rôle, renvoie systématiquement une erreur 403. En cas d'erreur 403, ne réessayez pas ; vérifiez et modifiez le contenu de votre requête.
Limites de capacité
Quelle est la longueur du contexte et la taille maximale de la sortie ?
Fenêtre de contexte de 100 000 tokens. L’entrée et la sortie combinées ne doivent pas dépasser cette limite. max_tokens par défaut 2 048, max 32 000. Un 400 est renvoyé si entrée + max_tokens dépasse la limite.
Le streaming et l'appel de fonctions sont-ils supportés ?
Oui. Définissez stream sur true pour obtenir un flux SSE. L'appel de fonctions utilise le format OpenAI tools. Les paramètres de sampling (temperature, top_p, stop) sont transmis tels quels.
Pouvez-vous générer des vecteurs, des images ou de l'audio ?
Non. Nous fournissons uniquement la génération de texte. Aucun support pour les vecteurs, images, audio, vidéo ou le fine-tuning n'est disponible. Utilisez d'autres solutions pour ces besoins.
Le corps de la requête a-t-il une limite de taille ?
Oui, il ne doit pas dépasser 8 MB. Lors de l'envoi de longs documents, surveillez à la fois le nombre de tokens et la taille totale en octets.
Mise en production et opérations courantes
Quelles sont les actions prioritaires avant la mise en production ?
Vérifiez d’abord /v1/models, puis testez avec de longs prompts, le streaming et les erreurs. Gérez 402, 429, 503 et journalisez usage. Définissez une alerte de solde. Intégrez ces vérifications dans le processus de release, confirmées point par point par le collègue de service.
Que faire si tous les appels en production retournent une erreur 401 ?
Vérifiez d'abord si quelqu'un a régénéré la clé dans le panneau d'administration, car l'ancienne clé devient immédiatement invalide après régénération. Ensuite, vérifiez si les variables d'environnement ont été perdues lors du dernier déploiement, ou si des espaces et des sauts de ligne ont été accidentellement inclus dans la clé. Conserver la clé active en vigueur en un seul endroit permet d'éliminer la majorité de ces cas de figure.
Que faut-il faire lorsque plusieurs services partagent la même clé ?
La limite est agrégée par clé : total ≤ 300 requêtes/min. Si un lot consomme la limite, les services en ligne reçoivent un 429. Limitez les lots, priorisez les requêtes en ligne et exécutez les lots la nuit hors pic si nécessaire.
Comment éviter que les coûts ne dépassent silencieusement les prévisions ?
Le prix par token de sortie est quatre fois supérieur à celui des tokens d'entrée ; privilégiez donc le contrôle de max_tokens et la longueur des prompts. Analysez ensuite l'utilisation par fonctionnalité : si le volume de sortie moyen d'une fonction double soudainement, vérifiez si cela est dû à une modification du prompt. L'avantage du mode prépayé est que le service s'arrête dès que le solde est épuisé, évitant ainsi des factures surprises.
Contenu et confidentialité
Quels contenus sont autorisés ?
Le contenu adulte légal, les créations fictives et les sujets controversés ne sont pas refusés. Service pour adultes de 18 ans et plus. Le contenu sexuel impliquant des mineurs est toujours bloqué. Voir Coûts et compromis.
Mes prompts seront-ils utilisés pour l'entraînement ?
Non, les prompts ne sont pas utilisés pour l'entraînement. En dehors de cela, cette page ne fournit pas d'autres détails sur le stockage ou les logs ; veuillez vous référer à la documentation complète.
En quoi ce service diffère-t-il d'un agrégateur (gateway) ?
Un seul modèle, pas de mappage complexe. Vérifiez via /v1/models. Pour les principes et risques du transit, lisez Principe du transit.
Questions fréquentes
Comment commencer à utiliser le service ?
Inscrivez-vous avec votre adresse e-mail et votre mot de passe ; votre clé s'affiche immédiatement, sans saisie d'informations de paiement. Un nouveau compte bénéficie d'un crédit d'essai gratuit de 0,50 $, valable 7 jours.
Que faire en cas de retour 402 ?
402 (no_credit) : solde épuisé ou crédit d'essai expiré. Rechargez votre crédit prépayé. Ne réessayez pas.
Quelle est la limite de débit ?
Chaque clé est limitée à 300 requêtes par minute ; au-delà, une erreur 429 est renvoyée. Il est recommandé d'utiliser une limite de concurrence et une stratégie de réessai avec backoff pour lisser les envois.
Quelle est la taille maximale du contexte et des sorties ?
La fenêtre de contexte totale est de 100 000 tokens. max_tokens est par défaut de 2048 et peut aller jusqu'à 32 000. Le corps de la requête ne doit pas dépasser 8 Mo.
Les prompts sont-ils utilisés pour l'entraînement ?
Non, les prompts ne sont pas utilisés pour l'entraînement.
Remplissez simplement le formulaire pour obtenir votre clé
Créez un compte, copiez votre clé et modifiez l'URL de base. La configuration est aussi simple que cela.