# Novita AI

> Novita AI: OpenAI-compatible inference at scale.

Source: https://tokenmojo.ai/providers/novita-ai

## Stats

- Models published: 31
- Average quality: 56.5
- Median speed: 35.8 tok/s
- Average reliability: 65.0%
- Lowest output price: $0.00 per 1M tokens
- Total samples: 5538

## Description

Novita AI delivers high-performance LLM inference through an OpenAI API-compatible interface. TokenMojo benchmarks its latency, cost, and throughput against other providers to support objective vendor selection.

## Models

- [cobuddy](https://tokenmojo.ai/models/novita-ai/baidu-cobuddy): Novita AI hosts Baidu CoBuddy featuring 131k context window and reasoning support.
- [deepseek-v3.2](https://tokenmojo.ai/models/novita-ai/deepseek-v3-2): DeepSeek V3.2 via Novita AI: 163840 token context, reasoning, and JSON mode capabilities.
- [deepseek-v4-flash](https://tokenmojo.ai/models/novita-ai/deepseek-v4-flash): DeepSeek V4 Flash on Novita AI provides 1M context, reasoning, and JSON mode at $0.14 per million input tokens.
- [deepseek-v4-pro](https://tokenmojo.ai/models/novita-ai/deepseek-v4-pro): DeepSeek-V4-Pro: High-context reasoning via Novita AI.
- [gemma-4-26b-a4b-it](https://tokenmojo.ai/models/novita-ai/gemma-4-26b-a4b-it): Google Gemma 4 26B IT on Novita AI features 262K context, vision, and reasoning capabilities.
- [gemma-4-31b-it](https://tokenmojo.ai/models/novita-ai/gemma-4-31b-it): Google Gemma 4 31B IT via Novita AI features 262K context, vision, reasoning, and JSON mode support.
- [glm-4.7](https://tokenmojo.ai/models/novita-ai/glm-4-7): Compare GLM-4.7 pricing and specs on TokenMojo.
- [glm-4.7-flash](https://tokenmojo.ai/models/novita-ai/glm-4-7-flash): Novita AI provides access to ZAI Org's GLM-4.7-Flash with 200K context and reasoning.
- [glm-5.1](https://tokenmojo.ai/models/novita-ai/glm-5-1): glm-5.1 on Novita AI provides 204800 token context, JSON mode, and reasoning capabilities.
- [glm-5.2](https://tokenmojo.ai/models/novita-ai/zai-org-glm-5-2)
- [hy3](https://tokenmojo.ai/models/novita-ai/tencent-hy3)
- [kimi-k2.5](https://tokenmojo.ai/models/novita-ai/kimi-k2-5): Kimi K2.5 offers 262K context window, vision, reasoning, and JSON mode via Novita AI.
- [kimi-k2.6](https://tokenmojo.ai/models/novita-ai/kimi-k2-6): Kimi K2.6 on Novita AI provides 262K context window, vision, reasoning, and JSON mode support.
- [kimi-k2.7-code](https://tokenmojo.ai/models/novita-ai/moonshotai-kimi-k2-7-code)
- [kimi-k3](https://tokenmojo.ai/models/novita-ai/moonshotai-kimi-k3)
- [ling-3.0-flash](https://tokenmojo.ai/models/novita-ai/inclusionai-ling-3-0-flash)
- [llama-4-maverick-17b-128e-instruct-fp8](https://tokenmojo.ai/models/novita-ai/llama-4-maverick-17b-128e-instruct-fp8): Meta Llama 4 Maverick 17B Instruct FP8 via Novita AI offers 1M context window and vision capabilities.
- [llama-4-scout-17b-16e-instruct](https://tokenmojo.ai/models/novita-ai/llama-4-scout-17b-16e-instruct): Meta Llama 4 Scout 17B on Novita AI with 131K context and vision capabilities.
- [macaron-v1-venti](https://tokenmojo.ai/models/novita-ai/mindai-macaron-v1-venti)
- [minimax-m2.5](https://tokenmojo.ai/models/novita-ai/minimax-m2-5): Minimax-M2.5 on Novita AI delivers 204K context, reasoning tools, and transparent token-based pricing.
- [minimax-m2.5-highspeed](https://tokenmojo.ai/models/novita-ai/minimax-m2-5-highspeed): Minimax M2.5 Highspeed via Novita AI features 204K context and structured output support.
- [minimax-m2.7](https://tokenmojo.ai/models/novita-ai/minimax-m2-7): Minimax-M2.7 via Novita AI delivers 204K context, 131K max output, reasoning, and JSON mode support.
- [minimax-m3](https://tokenmojo.ai/models/novita-ai/minimax-minimax-m3): Minimax-M3 on Novita AI delivers 1M token context, vision, and reasoning with structured JSON output support.
- [nemotron-3-nano-30b-a3b](https://tokenmojo.ai/models/novita-ai/nvidia-nemotron-3-nano-30b-a3b)
- [nex-n2-pro](https://tokenmojo.ai/models/novita-ai/nex-agi-nex-n2-pro): Novita AI nex-n2-pro: 262K context, vision, reasoning, JSON mode, and $0.0000 per million token pricing.
- [qwen3.5-122b-a10b](https://tokenmojo.ai/models/novita-ai/qwen3-5-122b-a10b): Qwen3.5-122B-A10B via Novita AI features 262K context, vision, reasoning, and JSON mode.
- [qwen3.5-27b](https://tokenmojo.ai/models/novita-ai/qwen3-5-27b): Qwen3.5-27B on Novita AI: 262K context, vision, reasoning.
- [qwen3.5-35b-a3b](https://tokenmojo.ai/models/novita-ai/qwen3-5-35b-a3b): Qwen3.5-35B-A3B via Novita AI features 262K context, vision, and reasoning.
- [qwen3.5-397b-a17b](https://tokenmojo.ai/models/novita-ai/qwen3-5-397b-a17b): Qwen 3.5 397B via Novita AI features 262K context, vision, and reasoning.
- [qwen3.6-27b](https://tokenmojo.ai/models/novita-ai/qwen3-6-27b): Qwen3.6-27b via Novita AI features 262K context, vision, reasoning, and JSON mode.
- [step-3.7-flash](https://tokenmojo.ai/models/novita-ai/stepfun-step-3-7-flash)
