Najczęściej zadawane pytania dotyczące API przekaźnikowego: od uzyskania klucza do diagnostyki błędów
Tutaj skupiamy odpowiedzi na pytania, które developerzy zadają przy integracji i używaniu. Podział na pięć grup: początek, limity i rozliczenia, błędy, granice możliwości, treść i prywatność. Każda odpowiedź zawiera konkretne liczby i czynności. Możesz od razu sprawdzić swoją sytuację; jeśli nie znajdziesz odpowiedzi, wróć do dokumentacji i sprawdź szczegóły interfejsu.
Kluczowe informacje
- Rejestracja wymaga tylko e-maila i hasła; klucz API wyświetla się natychmiastowo. Nowe konto otrzymuje kredyt próbny w wysokości 0,50 USD ważny przez 7 dni, bez konieczności podawania danych do płatności.
- Błąd 402 oznacza brak środków, 429 oznacza zbyt szybkie wysyłanie zapytań, a 503 oznacza, że należy spróbować ponownie później. Metody rozwiązywania tych problemów są zupełnie inne.
- Okno kontekstu wynosi 100 000 tokenów, maksymalna długość outputu to 32 000 tokenów, a ciało zapytania nie może przekraczać 8 MB. Obsługiwany jest tylko tekst.
- Prompty nie są używane do trenowania.
Rozpocznij
Jak uzyskać pierwszy klucz API?
Przejdź do strony uzyskiwania klucza API i zarejestruj się za pomocą e-maila i hasła. Po zakończeniu rejestracji klucz API wyświetli się natychmiastowo na stronie. Nie musisz podawać żadnych danych do płatności; skopiuj klucz i ustaw go w zmiennej środowiskowej, aby rozpocząć wywoływanie API.
Ile kluczy API może mieć jedno konto?
Jeden klucz na konto. Jeśli musisz go zmienić, możesz go wygenerować ponownie. Pamiętaj: po wygenerowaniu nowego klucza stary przestaje obowiązywać natychmiast, a wszystkie usługi używające starego klucza zaczną otrzymywać błąd 401. Dlatego przygotuj najpierw proces wdrażania nowego klucza, zanim przejdziesz do operacji.
Jaki jest adres endpointu i jaka jest nazwa modelu?
Adres to https://api.llmzhongzhuan.com/v1,对话请求发往 /v1/chat/completions. Listę modeli uzyskasz za pomocą GET /v1/models. Dostępny jest tylko jeden model o nazwie uncensored.
Jak zmodyfikować istniejący kod OpenAI?
Zazwyczaj wystarczy zmienić dwa miejsca: zamień base_url na powyższy adres, zamień klucz na klucz naszej platformy i ustaw pole model na uncensored. Struktura ciała zapytania i odpowiedzi pozostaje zgodna z formatem completion czatu OpenAI, więc większość kodu nie wymaga zmian. Szczegóły konfiguracji dla konkretnych frameworków znajdziesz w konfiguracji frameworków.
Kredyty i rozliczenia
Ile wynosi kredyt próbny i jak jest naliczany?
Nowe konto otrzymuje 0,50 USD, które są ważne przez 7 dni. Koszt wynosi 0,25 USD za milion tokenów wejściowych i 1,00 USD za milion tokenów wyjściowych. Przy założeniu, że każde zapytanie zużywa 800 tokenów wejściowych i 400 tokenów wyjściowych, koszt jednego zapytania wynosi około 0,0006 USD. Kredyt próbny pozwoli na wysłanie około 800 takich zapytań. Jest to tylko szacunkowa kalkulacja; rzeczywista liczba zależy od długości Twoich promptów.
Czy saldo po doładowaniu wygaśnie?
Nie. Doładowujesz przedpłacony kredyt, nie ma subskrypcji ani reguły automatycznego kasowania salda. Wygaśnięciu ulega tylko kredyt próbny po 7 dniach.
Jak dowiedzieć się, ile kosztowało jedno zapytanie?
W odpowiedzi znajduje się obiekt usage zawierający liczbę tokenów wejściowych i wyjściowych. W przypadku strumieniowania, ostatni fragment odpowiedzi również zawiera obiekt usage. Koszt obliczasz, mnożąc te liczby przez jednostkowe ceny. Przykład implementacji monitorowania znajdziesz w Praktyki stabilności.
Gdzie znaleźć pełny cennik?
Ceny są zgodne z stroną cennika. Strona zawiera jasno określone ceny za tokeny wejściowe i wyjściowe; nie ma ukrytych opłat za każde zapytanie.
Błędy i limity
Co oznacza kod 402?
Kod błędu to no_credit, co oznacza, że saldo konta się wyczerpało lub kredyt próbny wygasł. Jedyne rozwiązanie: doładuj przedpłacony kredyt. Nie powtarzaj zapytania przy tym błędzie – powtórzenie nie odniesie sukcesu, a jedynie wygeneruje zbędne zapytania.
Jak radzić sobie z kodem 429?
Każdy klucz obsługuje maksymalnie 300 zapytań na minutę; po przekroczeniu limitu zwracany jest błąd 429. Najpierw zmniejsz częstotliwość wysyłania, a następnie zastosuj mechanizm powtórzeń z wykładniczym opóźnieniem i losowym jitterem. Przy przetwarzaniu wsadowym zalecamy użycie limitu współbieżności i semafora, aby wygładzić wysyłanie. Przykładowy kod znajdziesz w artykule o stabilności.
Czy 503 upstream_busy to awaria?
Nie jest to awaria trwała; oznacza tymczasowe obciążenie usługi. Zazwyczaj wystarczy odczekać kilka sekund i ponowić zapytanie. Zalecamy stosowanie wykładniczego backoffu oraz ograniczenie maksymalnej liczby prób ponownych.
Co oznacza 403 content_blocked?
Oznacza to, że zapytanie zostało zablokowane przez filtr treści. Zawierające treści seksualne z udziałem małoletnich (niezależnie od tego, czy są fikcyjne, czy w roli odgrywanej) są zawsze blokowane i zwracają kod 403. W przypadku 403 nie powtarzaj zapytania; sprawdź i zmodyfikuj jego treść.
Ograniczenia funkcjonalne
Jaka jest długość kontekstu i jaka jest maksymalna długość outputu?
Łączna długość okna kontekstu wynosi 100 000 tokenów; suma tokenów wejściowych i outputu nie może jej przekroczyć. max_tokens domyślnie to 2048, maksymalnie można ustawić 32 000. Jeśli suma tokenów wejściowych i max_tokens przekracza limit, zwracany jest błąd 400. Pamiętaj, aby zostawić miejsce na input przy generowaniu długich tekstów.
Czy obsługiwane jest strumieniowanie i wywoływanie funkcji?
Wszystko jest obsługiwane. Ustaw stream na true, aby otrzymać strumieniowanie SSE. Wywoływanie funkcji odbywa się w formacie tools OpenAI. Takie parametry próbkowania jak temperature, top_p czy stop są przekazywane dalej.
Czy można generować wektory, tworzyć obrazy lub generować mowę?
Nie. Nasza platforma oferuje tylko konwersację tekstową. Nie ma możliwości generowania wektorów, obrazów, audio, wideo ani fine-tuningu. Dostępny jest tylko jeden model. Jeśli Twoja aplikacja wymaga tych możliwości, musisz skorzystać z dodatkowych rozwiązań.
Czy ciało zapytania ma ograniczenia rozmiarowe?
Tak, pojedyncze ciało zapytania nie może przekraczać 8 MB. Umieszczając długie dokumenty w prompcie, zwracaj uwagę nie tylko na liczbę tokenów, ale także na całkowitą liczbę bajtów.
Wdrożenie i codzienna konserwacja
Jakie kroki należy wykonać przed oficjalnym wdrożeniem?
Najpierw sprawdź listę modeli za pomocą /v1/models, a następnie przeprowadź testy obejmujące długie wejścia, strumieniowanie i ścieżki błędów. Następnie przygotuj gałęzie obsługi dla błędów 402, 429 i 503 oraz zapisuj metryki użycia na dysku. Na koniec ustaw próg alertu dla salda, aby nie odkryć wyczerpania środków w godzinach szczytu. Nie zapomnij dodać tych punktów kontrolnych do procesu wydania wersji i potwierdź je z osobą dyżurną.
Co sprawdzić, gdy online wszystkie odpowiedzi zwracają 401?
Najpierw sprawdź, czy ktoś nie wygenerował ponownie klucza w panelu, ponieważ po jego ponownym wygenerowaniu stary klucz traci ważność natychmiast. Następnie sprawdź, czy zmienne środowiskowe nie zostały utracone podczas ostatniego wdrożenia lub czy w kluczu nie znalazły się przypadkowo spacje i znaki nowej linii. Przechowywanie aktywnego klucza tylko w jednym miejscu pozwala wyeliminować większość tego typu problemów.
Na co zwrócić uwagę, gdy kilka usług dzieli ten sam klucz?
Limit zapytań jest liczony łącznie dla klucza; suma wszystkich zapytań ze wszystkich usług nie może przekraczać 300 na minutę. Jeśli jedno zadanie wsadowe wyczerpie limit, usługa online również otrzyma błąd 429. Zalecamy ustawienie osobnego limitu dla zadań wsadowych, nadanie wyższego priorytetu zapytaniom online i wykonywanie zadań wsadowych w godzinach nocnych, aby uniknąć szczytów.
Jak uniknąć niekontrolowanego przekraczania budżetu?
Cena za token wyjściowy jest cztery razy wyższa niż za token wejściowy, dlatego priorytetowo ograniczaj max_tokens i objętość tekstu żądanego w promptach. Analizuj użycie według funkcji; jeśli średnia ilość tokenów wyjściowych nagle się podwoi, sprawdź, czy nie była to spowodowana zmianą promptów. Zaletą modelu prepaid jest to, że usługa zatrzymuje się po wyczerpaniu środków, co eliminuje niespodziewane rachunki.
Treść i prywatność
Jakie treści są dozwolone?
Legalna treść dla dorosłych, twórczość fikcyjna i tematy kontrowersyjne nie są automatycznie odrzucane; usługa jest przeznaczona dla użytkowników powyżej 18. roku życia. Treści seksualne z udziałem nieletnich są zawsze blokowane. Aby poznać koszty i kompromisy związane z tego typu usługami, przeczytaj Koszty i kompromisy API AI bez cenzury.
Czy moje prompty będą używane do trenowania?
Nie, prompty nie są używane do trenowania. Poza tym ta strona nie podaje szczegółów dotyczących innych form przechowywania lub logów; prosimy o odwołanie się do dokumentacji.
Czym ta usługa różni się od agregatorów proxy?
Nasza platforma oferuje tylko jeden model, więc nie musisz mapować wielu nazw modeli. Listę modeli możesz samodzielnie sprawdzić za pomocą /v1/models. Aby poznać ogólne zasady działania i ryzyka związane z API przekaźnikowym, przeczytaj najpierw artykuł o zasadach działania przekaźnika.
Najczęściej zadawane pytania
Jak zacząć?
Zarejestruj się za pomocą adresu e-mail i hasła; klucz pojawi się natychmiast, bez konieczności podawania danych do płatności. Nowe konto otrzymuje kredyt próbny w wysokości 0,50 USD, ważny przez 7 dni.
Co zrobić, gdy zwrócono 402?
Kod błędu 402 to no_credit, co oznacza wyczerpanie salda lub wygaśnięcie kredytu próbnego. Doładuj saldo prepaid i nie próbuj ponowić zapytania.
Jaki jest limit zapytań?
Każdy klucz obsługuje 300 zapytań na minutę; po przekroczeniu limitu zwracany jest błąd 429. Zalecamy stosowanie limitu współbieżności wraz z mechanizmem powtórzeń z wykładniczym opóźnieniem, aby wygładzić wysyłanie.
Jaka jest maksymalna długość kontekstu i wyjścia?
Całkowita długość kontekstu to 100,000 tokenów, max_tokens domyślnie 2048, maksymalnie 32,000, ciało zapytania nie przekracza 8 MB.
Czy prompty są używane do trenowania?
Nie, prompty nie są używane do trenowania.
Wypełnij formularz, aby uzyskać klucz
Utwórz konto, skopiuj klucz i zmień Base URL. Konfiguracja jest taka prosta.