IT ▾

FAQ API proxy: dalla chiave al debug degli errori

Rispondiamo qui alle domande ricorrenti degli sviluppatori durante l'integrazione e l'uso, organizzate in cinque gruppi: avvio, crediti e fatturazione, errori, limiti di capacità, contenuti e privacy. Ogni risposta punta a numeri e azioni concrete: cerca la tua situazione, se non la trovi, torna alla documentazione per i dettagli dell'endpoint.

Aggiornato il

Punti chiave

  1. La registrazione richiede solo email e password; la chiave appare subito. Nuovo account con 0,50 $ di credito di prova gratuito, valido 7 giorni, senza dati di pagamento.
  2. 402 indica che non hai saldo, 429 che le richieste sono troppo rapide, 503 che devi riprovare più tardi; i tre casi richiedono gestioni completamente diverse.
  3. Finestra di contesto di 100.000 token, output massimo di 32.000, corpo della richiesta sotto 8 MB, solo testo supportato.
  4. I prompt non vengono usati per il training.

Avvio

Come ottenere la prima chiave?

Vai alla pagina di ottenimento chiave, registrati con email e password. La chiave appare subito. Non servono dati di pagamento: copia la chiave, impostala come variabile d'ambiente e inizia a chiamare l'API.

Quante chiavi per account?

Una sola. Puoi rigenerarla, ma la vecchia scade subito: i servizi che la usano riceveranno 401. Prepara il flusso di distribuzione della nuova chiave prima di rigenerare.

Qual è l'indirizzo dell'endpoint e il nome del modello?

L'indirizzo è https://api.llmzhongzhuan.com/v1,对话请求发往 /v1/chat/completions. Elenco modelli con GET /v1/models. C'è un solo modello: uncensored.

Come modificare il codice OpenAI esistente?

Modifica solo due cose: base_url con l'indirizzo sopra, chiave con quella del sito, model con uncensored. La struttura del corpo e della risposta resta quella di OpenAI, quindi il codice non cambia. Vedi Configurazione framework per i dettagli.

Crediti e fatturazione

Quanto è il credito di prova e come si calcola?

Ai nuovi account vengono assegnati 0,50 $ con validità di 7 giorni. Con un costo di 0,25 $ per milione di token in input e 1,00 $ per milione in output, e supponendo 800 token in input e 400 in output per richiesta, il costo è di circa 0,0006 $ a richiesta: il credito di prova gratuito permette di inviare oltre 800 richieste di questo tipo. Questa è solo una stima basata su ipotesi; il valore effettivo dipende dalla lunghezza del tuo prompt.

Il saldo dopo la ricarica scade?

No. Il credito prepagato non ha scadenza né regole di azzeramento. Solo il credito di prova gratuito scade dopo 7 giorni.

Come sapere quanto costa una richiesta?

La risposta include usage con i conteggi token. Nello streaming, l'ultimo frammento contiene usage. Moltiplica i token per il prezzo unitario. Per il monitoraggio, vedi Pratiche di stabilità.

Dove vedere i prezzi completi?

Ai prezzi della pagina Prezzi. Sono indicati input e output per token, senza costi nascosti.

Errori e limiti di richiesta

Cosa significa 402?

Codice no_credit: saldo esaurito o credito di prova scaduto. Soluzione: ricarica il credito prepagato. Non ripetere la richiesta: fallirà e genererà richieste extra.

Come gestire il 429?

300 richieste al minuto per chiave, poi 429. Riduci il rate e usa un backoff retry con random jitter. Per il batch usa il limite di parallel requests con un metronomo. Vedi il codice nella sezione stabilità.

503 upstream_busy è un guasto?

No, è un servizio temporaneamente occupato. Riprova dopo qualche secondo. Usa backoff esponenziale e limita i tentativi.

Cos'è 403 content_blocked?

Questo indica che la richiesta ha attivato un filtro sui contenuti. I contenuti sessuali che coinvolgono minori, siano essi reali o di fantasia (incluso il roleplay), restituiscono sempre un 403. In caso di 403, non riprovare: verifica e modifica il contenuto della richiesta.

Limiti di capacità

Quanto è lungo il contesto e quanto può essere lungo l'output?

Finestra di contesto di 100.000 token: input + max_tokens non può superarla. max_tokens default 2048, max 32.000. Superato il limite, errore 400.

Supportano streaming e chiamata di funzioni?

Sì. Imposta stream=true per output SSE. La chiamata di funzioni usa il formato tools di OpenAI. temperature, top_p, stop vengono passati direttamente.

Posso fare vettori, immagini o audio?

No. Solo testo. Nessun embedding, immagine, audio, video o fine-tuning. Un solo modello. Per altre capacità, usa soluzioni esterne.

Il corpo della richiesta ha un limite di dimensione?

Sì, max 8 MB. Quando inserisci documenti lunghi nel prompt, controlla sia i token che i byte totali.

Produzione e manutenzione

Cosa fare prima del lancio in produzione?

Usa prima /v1/models per confermare l'elenco dei modelli, poi esegui un test che includa input lunghi, streaming e percorsi di errore. Scrivi poi i rami di gestione per 402, 429 e 503 e salva i dati di utilizzo. Imposta un avviso per il saldo per evitare di scoprire l'esaurimento del credito solo durante i picchi di traffico. Non dimenticare di includere questi controlli nella procedura di rilascio, con verifica puntuale da parte del team di turno.

Se online tutti i servizi restituiscono 401, cosa controlli per primo?

Verifica prima se qualcuno ha rigenerato la chiave dall'interfaccia di gestione, perché la chiave precedente diventa immediatamente invalida alla rigenerazione. Controlla poi se le variabili d'ambiente sono state perse nell'ultimo rilascio o se nella chiave sono stati inseriti spazi e a capo. Conservare la chiave attiva in un unico posto elimina la maggior parte di questi problemi.

Cosa fare quando più servizi condividono la stessa chiave?

Il rate limit è aggregato per chiave API: il totale non deve superare 300 richieste/min. Se il batch occupa tutto, anche il servizio online riceve 429. Assegna un rate limit separato al batch e dai priorità alle richieste online.

Come evitare che i costi superino inaspettatamente le previsioni?

Il prezzo per token di output è quattro volte quello degli input, quindi controlla prima max_tokens e la lunghezza richiesta nel prompt. Analizza poi l'usage per funzionalità: se l'output medio di una funzione raddoppia improvvisamente, verifica se è dovuto a modifiche al prompt. Il vantaggio del modello prepaid è che il servizio si interrompe quando il saldo è esaurito, evitando bolle inaspettate.

Contenuti e privacy

Quali contenuti sono consentiti?

Contenuti per adulti, fiction e temi controversi non sono rifiutati; il servizio è rivolto agli utenti adulti (18+). I contenuti sessuali che coinvolgono minori sono sempre bloccati. Leggi Costi e compromessi.

I miei prompt verranno usati per l'addestramento?

No, i prompt non verranno utilizzati per l'addestramento. Per gli altri dettagli su archiviazione e log, fai riferimento alla documentazione.

In che cosa questo servizio differisce da un gateway aggregato?

Offriamo un solo modello, quindi non ci sono molti nomi di modello da mappare. Verifica la lista con /v1/models. Per i principi generali leggi Principi.

Domande frequenti

Come iniziare?

Registrati con email e password; la chiave verrà visualizzata immediatamente senza bisogno di inserire i dati di pagamento. Il nuovo account riceve un credito di prova di 0,50 $ valido per 7 giorni.

Cosa fare se ricevo un 402?

Il codice di errore 402 è no_credit, che indica saldo esaurito o fine della prova: devi ricaricare il credito prepaid, non riprovare.

Qual è il rate limit?

300 richieste/min per chiave, poi 429. Usa il limite di parallel requests e un backoff retry per gestire il traffico.

Qual è la lunghezza massima del contesto e dell'output?

Finestra di contesto di 100.000 token, max_tokens predefinito 2048 e massimo 32.000, corpo della richiesta non superiore a 8 MB.

I prompt verranno usati per l'addestramento?

No, i prompt non verranno utilizzati per l'addestramento.

Compila il modulo per ottenere la chiave

Crea un account, copia la chiave e modifica il Base URL. La configurazione è così semplice.

Ottieni la chiave API