rate card
Models & pricing
The specialist models we've benchmarked, hosted and priced — with the long tail we're onboarding next below. Prices are in each model's native unit; realtime is the on-demand rate, batch is a discounted flexible tier (send X-Tier: batch).
| model | task | tier | realtime | batch |
|---|---|---|---|---|
| meta-llama/Llama-3.1-8B-Instruct | text generation | $0.08333/1M tok | $0.04167/1M tok | |
| Qwen/Qwen3.5-4B | vision-language | $0.25/1M tok | $0.125/1M tok | |
| Qwen/Qwen3-4B-Instruct-2507 | text generation | $0.05/1M tok | $0.025/1M tok | |
| Qwen/Qwen3-VL-4B-Instruct | vision-language | $1/1M tok | $0.5/1M tok | |
| Qwen/Qwen3.5-0.8B | vision-language | $0.08333/1M tok | $0.04167/1M tok | |
| deepseek-ai/DeepSeek-OCR | vision-language | $0.16667/1M tok | $0.08333/1M tok | |
| Qwen/Qwen3-Reranker-0.6B | text ranking | $0.01667/1M tok | $0.00833/1M tok | |
| Qwen/Qwen3-Reranker-4B | text ranking | $0.04167/1M tok | $0.02083/1M tok | |
| Qwen/Qwen3.5-2B | vision-language | $0.16667/1M tok | $0.08333/1M tok | |
| intfloat/multilingual-e5-large-instruct | embeddings | $0.01667/1M tok | $0.00833/1M tok | |
| google/embeddinggemma-300m | embeddings | $0.00333/1M tok | $0.00167/1M tok | |
| deepreinforce-ai/Ornith-1.0-35B | text generation | $1.66667/1M tok | $0.83333/1M tok |