Primera petición en cinco minutos
Comienza con la API de LLM sin censura de Apertus en minutos. Esta guía rápida cubre la autenticación, peticiones básicas y streaming usando la interfaz compatible con OpenAI.
URL base y autenticación
Accede a la API usando la URL base dedicada https://api.apertus.top/v1. El servicio es compatible con OpenAI, lo que significa que puedes usar SDK estándar actualizando el base_url y proporcionando tu clave de API. Regístrate en la página Obtener clave de API usando Google o una dirección de correo electrónico. Tu clave se muestra inmediatamente tras su creación. Cada cuenta tiene una clave activa; generar una nueva reemplaza a la anterior. No hay suscripciones mensuales ni fechas de caducidad de la clave. El crédito prepago no caduca y los fondos no utilizados permanecen disponibles para futuras peticiones. Los errores y rechazos no consumen tu crédito.
Primera petición
Envía una petición simple de finalización de texto para probar la conectividad y la facturación. Usa el ID de modelo uncensored para acceder al único modelo de pesos abiertos alojado en nuestros servidores. Este modelo está ajustado para responder sin rechazos de contenido para uso adulto lícito. La URL base es https://api.apertus.top/v1. La tarificación es transparente: $0,25 por cada 1M de tokens de entrada y $1,00 por cada 1M de tokens de salida. Solo pagas por lo que usas.
curl https://api.apertus.top/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
La respuesta devuelve el texto generado. Si tu crédito es insuficiente, recibirás un error de facturación. Los errores durante el procesamiento no cargan tu cuenta. Puedes recargar usando USDT (TRC20) o USDC (Base) a través del panel de control.
Integración con SDK de Python
Usa el SDK de Python oficial de OpenAI o cualquier cliente compatible. Establece el base_url en https://api.apertus.top/v1 y proporciona tu clave de API. Esto te permite aprovechar las bases de código existentes diseñadas para OpenAI. El endpoint /v1/chat/completions gestiona toda la generación de texto. El ID de modelo es uncensored. Se admiten parámetros como temperature, top_p y stop. Las respuestas en streaming incluyen detalles de uso de tokens en el último fragmento. También están disponibles las llamadas a funciones y el modo JSON para salidas estructuradas.
from openai import OpenAI
client = OpenAI(base_url="https://api.apertus.top/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Integración con SDK de Node.js
Inicializa el cliente con la URL base de Apertus. La clase OpenAI acepta los parámetros de configuración estándar. Pasa tu clave de API y establece la URL base en https://api.apertus.top/v1. Esto garantiza la compatibilidad con las aplicaciones Node.js existentes. Se requiere el ID de modelo uncensored para todas las peticiones. Puedes controlar la longitud de la salida usando max_tokens. La salida máxima predeterminada es de 2.048 tokens si no se especifica, con un límite estricto de 32.000 tokens por petición.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.apertus.top/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Respuestas en streaming
Habilita el streaming estableciendo stream: true en tu petición. La API devuelve un flujo de Server-Sent Events (SSE). Cada fragmento contiene texto parcial. El último fragmento incluye las estadísticas completas de uso de tokens para la petición. Esto te permite mostrar los resultados en tiempo real mientras rastreas los costos. El streaming funciona con todos los parámetros, incluidas las llamadas a funciones. Asegúrate de que tu cliente gestione correctamente los eventos SSE. La ventana de contexto admite hasta 100.000 tokens para prompt y finalización combinados.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Límites, errores y contexto
La API aplica un límite de 300 peticiones por minuto por clave y permite 8 peticiones simultáneas. El tamaño máximo del cuerpo de la petición es de 8 MB. Si la clave de autenticación no es válida, recibes un error 401. Si tu crédito prepago se agota, recibes un error 402 que indica fondos insuficientes. El límite de peticiones se aplica según la cuota por minuto. La ventana de contexto es de 100.000 tokens en total. La salida máxima por petición es de 32.000 tokens. Las peticiones que superen este límite se manejan mediante el comportamiento estándar del modelo. No se garantizan porcentajes de SLA. Se mantiene la privacidad; los prompts no se utilizan para entrenamiento.
Funciones y límites
Una tabla con cada límite, función y precio.
| Elemento | Valor |
|---|---|
| Formato | compatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.apertus.top/v1 |
| ID del modelo | uncensored |
| Autenticación | Authorization: Bearer YOUR_KEY |
| Llamadas a funciones | sí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool |
| Streaming | sí: server-sent events; el último fragmento incluye el uso de tokens |
| Salida máxima | hasta el resto de la ventana de 64.000 tokens; max_tokens opcional (sin límite aparte) |
| Parámetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Modo JSON | response_format: {"type": "json_object"} |
| Ventana de contexto | 64.000 tokens (entrada + salida) |
| Límite de peticiones | 300 por minuto por clave |
| Concurrencia | 8 peticiones a la vez por clave |
| Cabeceras | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Tamaño de petición | hasta 8 MB |
| Bono | +5 % desde $50, +10 % desde $100 |
| Prueba gratis | $0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga |
| Facturación | crédito prepago por uso real; errores y rechazos no se cobran |
| Recarga | USDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500 |
| Caducidad | el crédito pagado no caduca, sin suscripción |
| Precio | $0,25 por 1M tokens de entrada · $1,00 por 1M de salida |
| Acceso | Google o correo y contraseña |
| Contenido | contenido adulto permitido; se rechaza el contenido sexual con menores |
| Claves | una clave activa por cuenta; una nueva reemplaza a la anterior |
Códigos de error
Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo |
401 | missing_key · invalid_key · key_revoked | falta la clave, es incorrecta o fue reemplazada |
402 | no_credit | sin crédito: recarga y sigue al instante |
403 | content_blocked | contenido sexual con menores: rechazado, no se cobra |
404 | not_found | endpoint desconocido |
413 | request_too_large | cuerpo mayor de 8 MB |
429 | rate_limited · concurrency | más de 300/min o 8 en paralelo: espera y reintenta |
503 | upstream_busy | modelo ocupado: reintenta en unos segundos |
Preguntas y respuestas
¿Mi clave de API caduca?
No, tu clave de API no caduca. No hay suscripciones mensuales ni cargos recurrentes asociados a tu cuenta. Puedes usar tu clave indefinidamente hasta que decidas revocarla.
¿Qué ocurre si supero el límite de peticiones?
La API limita a 300 peticiones por minuto por clave. Si excedes este límite, las peticiones posteriores pueden retrasarse o rechazarse. También puedes realizar 8 peticiones simultáneas a la vez. Monitorea tu uso para mantenerte dentro de estos límites.
¿Se truncará la salida si supera los 32.000 tokens?
El modelo admite una salida máxima de 32.000 tokens por petición. Si el texto generado supera este límite, la respuesta se truncará por el modelo. Puedes ajustar el parámetro <code>max_tokens</code> para controlar la longitud de la salida dentro de este límite.
Tu clave está a un formulario de distancia
Crea una cuenta, copia la clave, cambia la URL base. Esa es toda la configuración.