Pierwsze zapytanie w pięć minut
Zacznij korzystać z API LLM bez cenzury Apertus w kilka minut. Ten szybki przewodnik obejmuje uwierzytelnianie, podstawowe zapytania i strumieniowanie przy użyciu interfejsu kompatybilnego z OpenAI.
Podstawowy URL i autoryzacja
Uzyskaj dostęp do API za pomocą dedykowanego podstawowego URL https://api.apertus.top/v1. Usługa jest kompatybilna z OpenAI, co oznacza, że możesz używać standardowych SDK, aktualizując base_url i podając swój klucz API. Zarejestruj się na stronie Pobierz klucz API używając Google lub adresu e-mail. Twój klucz jest wyświetlany natychmiast po utworzeniu. Każde konto posiada jeden aktywny klucz; wygenerowanie nowego zastępuje poprzedni. Nie ma miesięcznych subskrypcji ani dat wygaśnięcia klucza. Przedpłacony kredyt nigdy nie wygasa, a niewykorzystane środki pozostają dostępne do przyszłych zapytań. Błędy i odrzucenia nie zużywają Twojego kredytu.
Pierwsze zapytanie
Wyślij proste zapytanie o uzupełnienie tekstu, aby przetestować łączność i rozliczenie. Użyj identyfikatora modelu uncensored, aby uzyskać dostęp do jedynego modelu o otwartych wagach hostowanego na naszych serwerach. Model ten jest dostosowany do odpowiadania bez odmów treści dla legalnego użytku dorosłego. Podstawowy URL to https://api.apertus.top/v1. Ceny są przejrzyste: $0,25 za 1M tokenów wejściowych i $1,00 za 1M tokenów wyjściowych. Płacisz tylko za to, czego używasz.
curl https://api.apertus.top/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Odpowiedź zwraca wygenerowany tekst. Jeśli Twój kredyt jest niewystarczający, otrzymasz błąd rozliczeniowy. Błędy podczas przetwarzania nie obciążają Twojego konta. Możesz doładować środki za pomocą USDT (TRC20) lub USDC (Base) przez panel sterowania.
Integracja z Python SDK
Użyj oficjalnego Python SDK OpenAI lub dowolnego kompatybilnego klienta. Ustaw base_url na https://api.apertus.top/v1 i podaj swój klucz API. Pozwala to wykorzystać istniejące bazy kodu zaprojektowane dla OpenAI. Endpoint /v1/chat/completions obsługuje całą generację tekstu. Identyfikator modelu to uncensored. Obsługiwane są parametry takie jak temperature, top_p i stop. Odpowiedzi strumieniowe zawierają szczegóły użycia tokenów w ostatnim fragmencie. Wywoływanie funkcji i tryb JSON są również dostępne dla danych ustrukturyzowanych.
from openai import OpenAI
client = OpenAI(base_url="https://api.apertus.top/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Integracja z Node SDK
Zainicjuj klienta za pomocą podstawowego URL Apertus. Klasa OpenAI akceptuje standardowe parametry konfiguracji. Przekaż swój klucz API i ustaw podstawowy URL na https://api.apertus.top/v1. Zapewnia to kompatybilność z istniejącymi aplikacjami Node.js. Wymagany jest identyfikator modelu uncensored dla wszystkich zapytań. Możesz kontrolować długość wyniku za pomocą max_tokens. Domyślny maksymalny wynik to 2048 tokenów, jeśli nie zostanie określony, z twardym limitem 32 000 tokenów na zapytanie.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.apertus.top/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Odpowiedzi strumieniowe
Włącz strumieniowanie, ustawiając stream: true w swoim zapytaniu. API zwraca strumień Server-Sent Events (SSE). Każdy fragment zawiera częściowy tekst. Ostatni fragment zawiera pełne statystyki użycia tokenów dla zapytania. Pozwala to wyświetlać wyniki w czasie rzeczywistym, śledząc jednocześnie koszty. Strumieniowanie działa ze wszystkimi parametrami, w tym z wywoływaniem funkcji. Upewnij się, że Twój klient poprawnie obsługuje zdarzenia SSE. Okno kontekstu obsługuje do 100 000 tokenów dla promptu i uzupełnienia łącznie.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Limity, błędy i kontekst
API narzuca limit 300 zapytań na minutę na klucz i pozwala na 8 zapytań równoległych. Maksymalny rozmiar ciała zapytania to 8 MB. Jeśli klucz uwierzytelniający jest nieprawidłowy, otrzymasz błąd 401. Jeśli Twój przedpłacony kredyt zostanie wyczerpany, otrzymasz błąd 402 wskazujący na niewystarczające środki. Ograniczenie szybkości jest stosowane na podstawie limitu na minutę. Okno kontekstu wynosi 100 000 tokenów łącznie. Maksymalny wynik na zapytanie to 32 000 tokenów. Zapytania przekraczające ten limit są obsługiwane przez standardowe zachowanie modelu. Nie ma gwarantowanych procentów SLA. Prywatność jest zachowana; prompty nie są używane do trenowania.
Parametry API
Wszystkie rzeczywiste limity i funkcje API w jednym miejscu — sprawdź je przed doładowaniem.
| Element | Wartość |
|---|---|
| Format API | zgodne z OpenAI: działa każdy SDK OpenAI — zmień base URL i klucz |
| Endpointy | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.apertus.top/v1 |
| ID modelu | uncensored |
| Uwierzytelnianie | Authorization: Bearer YOUR_KEY |
| Wywoływanie funkcji | tak — tools, tool_choice; odpowiedź zawiera tool_calls, także w strumieniu; wyniki jako role: tool |
| Strumieniowanie | tak — server-sent events; ostatni fragment zawiera zużycie tokenów |
| Maks. odpowiedź | do reszty okna 64 000 tokenów; max_tokens opcjonalne (bez osobnego limitu) |
| Parametry | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Tryb JSON | response_format: {"type": "json_object"} |
| Okno kontekstu | 64 000 tokenów (wejście + odpowiedź) |
| Limit zapytań | 300 zapytań na minutę na klucz |
| Równoległe zapytania | do 8 jednocześnie na klucz |
| Nagłówki odpowiedzi | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Rozmiar zapytania | do 8 MB |
| Bonus | +5% od $50, +10% od $100 |
| Darmowy kredyt | $0,50 na 7 dni, bez karty · Klucz próbny: 2 równoległe żądania, 60 na minutę; pełne limity (8 i 300) po pierwszym doładowaniu |
| Rozliczenie | przedpłacony kredyt według rzeczywistego zużycia; błędy i odmowy są darmowe |
| Doładowanie | USDT (TRC20) lub USDC (Base), dowolna pełna kwota od $10 do $500 |
| Ważność | opłacony kredyt nie wygasa, bez subskrypcji |
| Cena | $0,25 za 1 mln tokenów wejścia · $1,00 za 1 mln tokenów wyjścia |
| Logowanie | Google albo e-mail i hasło |
| Treści | treści dla dorosłych dozwolone; treści seksualne z udziałem nieletnich są odrzucane |
| Klucze | jeden aktywny klucz na konto; nowy zastępuje stary |
Kody błędów
Błędy wracają jako JSON ze stałym type; nieudane i odrzucone zapytania są bezpłatne.
| Kod | Typ | Znaczenie |
|---|---|---|
400 | bad_request | błędny JSON, puste wiadomości, zły parametr lub za długi kontekst |
401 | missing_key · invalid_key · key_revoked | brak klucza, zły klucz lub klucz zastąpiony nowym |
402 | no_credit | brak kredytu — doładuj, działa od razu |
403 | content_blocked | treści seksualne z nieletnimi — odmowa, bez opłaty |
404 | not_found | nieznany endpoint |
413 | request_too_large | treść większa niż 8 MB |
429 | rate_limited · concurrency | ponad 300/min lub 8 równolegle — odczekaj i ponów |
503 | upstream_busy | model zajęty — ponów za kilka sekund |
Pytania i odpowiedzi
Czy mój klucz API wygasa?
Nie, Twój klucz API nie wygasa. Nie ma miesięcznych subskrypcji ani opłat cyklicznych związanych z Twoim kontem. Możesz używać klucza w nieskończoność, aż go odrzucisz.
Co się stanie, gdy przekroczę limit zapytań?
API ogranicza Cię do 300 zapytań na minutę na klucz. Jeśli go przekroczysz, kolejne zapytania mogą zostać opóźnione lub odrzucone. Możesz również wykonywać 8 zapytań równoległych jednocześnie. Monitoruj swoje zużycie, aby mieścić się w tych granicach.
Czy wynik jest obcinany, jeśli przekracza 32 000 tokenów?
Model obsługuje maksymalny wynik 32 000 tokenów na zapytanie. Jeśli wygenerowany tekst przekracza tę wartość, odpowiedź jest obcinana przez model. Możesz dostosować <code>max_tokens</code> parameter, aby kontrolować długość wyniku w ramach tego limitu.
Twój klucz jest o jeden formularz stąd
Utwórz konto, skopiuj klucz, zmień podstawowy URL. To cała konfiguracja.