Veelgestelde vragen over de gateway-API: van sleutel verkrijgen tot foutopsporing
Hier beantwoorden we de vragen die ontwikkelaars herhaaldelijk stellen bij integratie en gebruik, gegroepeerd in: aan de slag, tegoed en facturatie, fouten, capaciteitslimieten, en inhoud en privacy. Elk antwoord bevat concrete cijfers en acties. Zo vind je snel wat je nodig hebt; zoek verder in de documentatie als je iets mist.
Kernpunten
- Registratie vereist alleen e-mail en wachtwoord; je sleutel verschijnt direct. Nieuwe accounts krijgen $0,50 proeftegoed voor 7 dagen, zonder betaalgegevens.
- 402 betekent geen saldo, 429 betekent te veel verzoeken, 503 betekent probeer het later opnieuw. De aanpak voor elk is anders.
- Contextvenster van 100.000 tokens, max. uitvoerlengte 32.000, request body tot 8 MB, alleen tekst ondersteund.
- Prompts worden niet gebruikt voor training.
Aan de slag
Hoe krijg je je eerste sleutel?
Ga naar de pagina voor het ophalen van de sleutel, registreer je met e-mail en wachtwoord. Na registratie verschijnt de sleutel direct op de pagina. Je hoeft geen betaalgegevens in te vullen; zet de sleutel in je omgevingsvariabelen en je kunt beginnen met aanroepen.
Hoeveel sleutels mag je per account hebben?
Eén per account. Je kunt een nieuwe genereren als je wilt wisselen, maar let op: de oude sleutel wordt direct ongeldig. Diensten die de oude sleutel nog gebruiken, krijgen dan 401-fouten. Zorg dat je het proces voor het uitrollen van de nieuwe sleutel klaar hebt staan voordat je dit doet.
Wat zijn het endpoint en de modelnaam?
Het adres is https://api.llmzhongzhuan.com/v1,对话请求发往 /v1/chat/completions. De lijst met modellen bekijk je via GET /v1/models. Er is maar één model, genaamd uncensored.
Hoe pas je bestaande OpenAI-code aan?
Meestal hoef je maar twee dingen aan te passen: vervang de base_url door het bovenstaande adres, vervang de sleutel door de sleutel van onze site en pas het model-veld aan naar uncensored. De structuur van request en response blijft compatibel met het OpenAI chat completion-formaat, dus de meeste code hoeft niet te veranderen. Zie frameworkconfiguratie voor specifieke framework-implementaties.
Tegoed en facturatie
Hoeveel proeftegoed krijg je en hoe wordt het berekend?
Nieuwe accounts krijgen 0,50 dollar, geldig voor 7 dagen. Berekening: 0,25 dollar per miljoen input-tokens, 1,00 dollar per miljoen output-tokens. Bij een input van 800 tokens en een output van 400 tokens kost een verzoek ongeveer 0,0006 dollar. Met het proeftegoed kun je ongeveer 800+ van zulke verzoeken doen. Dit is een schatting op basis van aannames; de werkelijke hoeveelheid hangt af van de lengte van je prompts.
Vervalt het saldo na het opladen?
Nee. Je laadt prepaid tegoed op zonder abonnement of vervaldatum. Alleen het proeftegoed vervalt na 7 dagen.
Hoeveel kost een verzoek?
De response bevat usage-informatie met het aantal input- en output-tokens. Bij streaming-verzoeken verschijnt er aan het einde automatisch een extra fragment met usage. Vermenigvuldig deze twee getallen met de eenheidsprijs om de kosten van dat verzoek te berekenen. Voor het opslaan van usage op schijf kun je de aanpak in stabiliteitspraktijken als referentie nemen.
Waar vind je de volledige prijzen?
De prijzen op de prijzenpagina zijn leidend. Er zijn geen verborgen kosten per verzoek; alleen de tarieven voor input en output.
Fouten en rate limits
Wat betekent 402?
Foutcode no_credit betekent dat het saldo op is of het proeftegoed is verlopen. De enige oplossing is je prepaid tegoed opwaarderen. Probeer niet opnieuw; dat leidt alleen tot extra verzoeken.
Hoe ga je om met 429?
Max. 300 verzoeken per minuut per sleutel, anders 429. Verlaag de snelheid en gebruik backoff met jitter. Gebruik een rate limiter voor batchverzoeken; zie de stabiliteitsgids voor code.
Is 503 upstream_busy een storing?
Nee, het is geen permanente storing. De service is tijdelijk druk. Probeer het na een paar seconden opnieuw, bij voorkeur met exponentiële backoff en een limiet voor het aantal pogingen.
Wat betekent 403 content_blocked?
Dit betekent dat de inhoud is geblokkeerd. Seksuele inhoud met minderjarigen (ook fictief) levert altijd 403 op. Probeer niet opnieuw; pas je verzoek aan.
Capaciteitslimieten
Hoe lang is de context en hoe lang mag de uitvoer zijn?
Het contextvenster is 100.000 tokens. Input en output samen mogen deze limiet niet overschrijden. max_tokens is standaard 2048, maximaal 32.000. Als input plus max_tokens de limiet overschrijdt, krijg je 400. Houd rekening met de inputlengte bij lange teksten.
Worden streaming en function calling ondersteund?
Ja. Stel stream in op true voor SSE-streaming. Function calling volgt het OpenAI-toolsformaat. Parameters zoals temperature, top_p en stop worden doorgegeven.
Kunnen we vectors, afbeeldingen of spraak gebruiken?
Nee. We bieden alleen tekstchat. Er zijn geen vector-, beeld-, audio-, video- of fine-tuningmogelijkheden. Er is slechts één model. Voor andere capabilities moet je een andere oplossing combineren.
Is er een limiet voor de request body?
Ja, de request body mag niet groter zijn dan 8 MB. Houd bij lange prompts niet alleen het tokenaantal, maar ook het totale byteaantal in de gaten.
Productie en onderhoud
Wat zijn de belangrijkste stappen vóór livegang?
Controleer eerst de modellijst via /v1/models en voer vervolgens tests uit met lange input, streaming en foutpaden. Schrijf vervolgens afzonderlijke verwerkingslogica voor 402, 429 en 503, en sla usage op schijf op. Stel ook een drempel in voor de saldiwaarschuwing, zodat je niet pas tijdens piekuren merkt dat je tegoed op is. Vergeet niet deze controlepunten op te nemen in je releaseproces, zodat het on-call team ze individueel kan bevestigen.
Wat moet je eerst controleren als online alle verzoeken een 401 retourneren?
Controleer eerst of iemand de sleutel op de achtergrond heeft geregend, omdat een oude sleutel direct ongeldig wordt na regeneratie. Controleer daarna of de omgevingsvariabelen bij de laatste release zijn verloren gegaan of dat er spaties en regeleinden in de sleutel zijn terechtgekomen. Het bewaren van de geldige sleutel op slechts één locatie voorkomt het merendeel van dit soort zoektochten.
Waar moet je op letten als meerdere services dezelfde sleutel delen?
Rate limiting wordt samengevoegd per sleutel; de totale verzoeken van alle services mogen niet meer dan 300 per minuut bedragen. Als een batchverwerking de limiet opmaakt, ontvangen online services ook een 429. Het is aan te raden een aparte rate limit voor batchtaken in te stellen, de prioriteit aan online verzoeken te geven en batchtaken bij voorkeur in de nacht uit te voeren om pieken te vermijden.
Hoe voorkom je dat kosten ongemerkt boven verwachting uitkomen?
De prijs per output token is vier keer zo hoog als die van input, dus beperk max_tokens en de lengte van de prompt voorrang. Analyseer het usage per functie; als de gemiddelde output van een functie plotseling verdubbelt, controleer dan of dit door wijzigingen in de prompt komt. Het voordeel van prepaid credit is dat de service stopt zodra het saldo op is, zodat er geen verrassende extra rekeningen ontstaan.
Inhoud en privacy
Welke inhoud wordt toegestaan?
Legale volwassen inhoud, fictie en controversiële onderwerpen worden niet direct geweigerd; de service is bedoeld voor volwassenen van 18 jaar en ouder. Seksuele inhoud met minderjarigen wordt echter altijd geblokkeerd. Lees de kosten en afwegingen van de onbeperkte AI API voor meer informatie over de kosten en compromissen van deze dienst.
Wordt mijn prompt gebruikt voor training?
Nee, je prompt wordt niet gebruikt voor training. Voor de overige opslag- of logdetails verwijzen we naar de documentatie.
Wat is het verschil tussen deze service en een aggregatiegateway?
Onze site biedt slechts één model aan, dus er hoeven geen modelnamen te worden gemapt. Je kunt de modellijst zelf controleren via /v1/models. Lees voor de algemene principes en risico's van gateways eerst de uitleg over gateways.
Veelgestelde vragen
Hoe begin ik?
Registreer met e-mail en wachtwoord; de sleutel verschijnt direct zonder dat je betaalgegevens hoeft in te vullen. Nieuwe accounts krijgen een proeftegoed van 0,50 dollar, geldig voor 7 dagen.
Wat te doen bij een 402-fout?
Foutcode 402 betekent no_credit: je saldo is op of je gratis proeftegoed is verlopen. Voer prepaid credit op en probeer niet opnieuw.
Wat is de rate limit?
Elke API-sleutel is beperkt tot 300 verzoeken per minuut; bij overschrijding krijg je een 429. Gebruik een concurrency limit met backoff voor herhalingen om de verzoeken soepel te verdelen.
Wat is de maximale lengte van context en output?
Totale contextlengte van 100.000 tokens, max_tokens standaard 2048, max. 32.000, request body tot 8 MB.
Wordt mijn prompt gebruikt voor training?
Nee, je prompt wordt niet gebruikt voor training.
Vul het formulier in om je sleutel te ontvangen
Maak een account aan, kopieer je sleutel en pas de Base URL aan. Zo eenvoudig is het.