Free LLM API resources

This lists various services that provide free access or credits towards API-based LLM usage.

[!NOTE]
Please don't abuse these services, else we might lose them.

[!WARNING]
This list explicitly excludes any services that are not legitimate (eg reverse engineers an existing chatbot)

Free Providers

OpenRouter

Limits:

20 requests/minute
50 requests/day
Up to 1000 requests/day with $10 lifetime topup

Models share a common quota.

Google AI Studio

Data is used for training when used outside of the UK/CH/EEA/EU.

Model Name Model Limits
Gemini 3.6 Flash 250,000 tokens/minute
20 requests/day
5 requests/minute
Gemini 3.5 Flash 250,000 tokens/minute
20 requests/day
5 requests/minute
Gemini 3 Flash 250,000 tokens/minute
20 requests/day
5 requests/minute
Gemini 3.5 Flash-Lite 250,000 tokens/minute
500 requests/day
15 requests/minute
Gemini 3.1 Flash-Lite 250,000 tokens/minute
500 requests/day
15 requests/minute
Gemini 2.5 Flash 250,000 tokens/minute
20 requests/day
5 requests/minute
Gemini 2.5 Flash-Lite 250,000 tokens/minute
20 requests/day
10 requests/minute
Gemini 3.1 Flash TTS 10,000 tokens/minute
10 requests/day
3 requests/minute
Gemini 2.5 Flash TTS 10,000 tokens/minute
10 requests/day
3 requests/minute
Gemini Robotics-ER 1.6 250,000 tokens/minute
20 requests/day
5 requests/minute
Gemini Robotics-ER 1.5 250,000 tokens/minute
20 requests/day
10 requests/minute
Gemma 4 31B Instruct 16,000 tokens/minute
14,400 requests/day
30 requests/minute
Gemma 4 26B A4B Instruct 16,000 tokens/minute
14,400 requests/day
30 requests/minute
Gemma 3 27B Instruct 15,000 tokens/minute
14,400 requests/day
30 requests/minute
Gemma 3 12B Instruct 15,000 tokens/minute
14,400 requests/day
30 requests/minute
Gemma 3 4B Instruct 15,000 tokens/minute
14,400 requests/day
30 requests/minute
Gemma 3 1B Instruct 15,000 tokens/minute
14,400 requests/day
30 requests/minute

NVIDIA NIM

Phone number verification required. Models tend to be context window limited.

Limits: 40 requests/minute

Mistral (La Plateforme)

Limits: Set per-model and per-organization — check your limits page. As of July 2026 a new free account sees anywhere from 25,000 to 20,000,000 tokens/minute and 0.03 to 12.5 requests/second depending on the model.

Mistral (Codestral)

Limits: 30 requests/minute, 2,000 requests/day

HuggingFace Inference Providers

HuggingFace Serverless Inference limited to models smaller than 10GB. Some popular models are supported even if they exceed 10GB.

Limits: $0.10/month in credits

Vercel AI Gateway

Routes to various supported providers.

The free tier covers a subset of the model catalogue, with per-model rate limits.

Limits: $5/month

Kilo Gateway

OpenAI-compatible gateway routing to various providers. Free models work without an account.

All free models may use your prompts for training.

Limits: 200 requests/hour per IP, shared across all free models

OpenCode Zen

AI gateway with curated models.

Free models may use data for improvement.

Cerebras

Model Name Model Limits
gpt-oss-120b 5 requests/minute
30,000 tokens/minute
1,000,000 tokens/hour
1,000,000 tokens/day
zai-glm-4.7 5 requests/minute
30,000 tokens/minute
1,000,000 tokens/hour
1,000,000 tokens/day
gemma-4-31b 5 requests/minute
30,000 tokens/minute
1,000,000 tokens/hour
1,000,000 tokens/day

Groq

Model Name Model Limits
Allam 2 7B 7,000 requests/day
6,000 tokens/minute
Llama 3.1 8B 14,400 requests/day
6,000 tokens/minute
Llama 3.3 70B 1,000 requests/day
12,000 tokens/minute
Whisper Large v3 2,000 requests/day
Whisper Large v3 Turbo 2,000 requests/day
canopylabs/orpheus-arabic-saudi
canopylabs/orpheus-v1-english
groq/compound 250 requests/day
70,000 tokens/minute
groq/compound-mini 250 requests/day
70,000 tokens/minute
meta-llama/llama-prompt-guard-2-22m
meta-llama/llama-prompt-guard-2-86m
openai/gpt-oss-120b 1,000 requests/day
8,000 tokens/minute
openai/gpt-oss-20b 1,000 requests/day
8,000 tokens/minute
openai/gpt-oss-safeguard-20b 1,000 requests/day
8,000 tokens/minute
qwen/qwen3.6-27b 1,000 requests/day
8,000 tokens/minute

Cohere

Limits:

20 requests/minute
1,000 requests/month

Models share a common monthly quota.

Cloudflare Workers AI

Limits: 10,000 neurons/day

Providers with trial credits

Fireworks

Credits: $1

Models: Various open models

Baseten

Credits: $30

Models: Any supported model - pay by compute time

Nebius

Credits: $1

Models: Various open models

Novita

Credits: $0.5 for 1 year

Models: Various open models

AI21

Credits: $10 for 3 months

Models: Jamba family of models

Upstage

Credits: $10 for 3 months

Models: Solar Pro/Mini

NLP Cloud

Credits: $15

Requirements: Phone number verification

Models: Various open models

Alibaba Cloud (International) Model Studio

Credits: 1 million tokens/model, valid for 90 days (Singapore endpoint only)

Models: Various open and proprietary Qwen models

Credits: $30/month on the Starter plan

Models: Any supported model - pay by compute time

Inference.net

Credits: $1, $25 on responding to email survey

Models: Various open models

Hyperbolic

Credits: $1

Models:

SambaNova Cloud

Credits: $5 for 3 months

Models:

Scaleway Generative APIs

Credits: 1,000,000 free tokens, plus 60 minutes of audio transcription

Models: