From cc27600bddec466339b5d3c581115c5cb73957ca Mon Sep 17 00:00:00 2001 From: Onkar Patil Date: Wed, 19 Aug 2026 13:34:39 -0700 Subject: [PATCH 1/6] feat: add openinfer provider with model mappings Adds OpenInfer (platform.openinfer.io) as an inference provider with mappings for Qwen 3.5 9B and Llama 3.2 1B Instruct, including new registry model entries for both. Co-Authored-By: Claude Fable 5 --- mappings/openinfer/llama-3-2-1b.yaml | 15 +++++++++++++++ mappings/openinfer/qwen3-5-9b.yaml | 15 +++++++++++++++ models/llama-3-2-1b.yaml | 13 +++++++++++++ models/qwen3-5-9b.yaml | 20 ++++++++++++++++++++ providers/openinfer.yaml | 14 ++++++++++++++ 5 files changed, 77 insertions(+) create mode 100644 mappings/openinfer/llama-3-2-1b.yaml create mode 100644 mappings/openinfer/qwen3-5-9b.yaml create mode 100644 models/llama-3-2-1b.yaml create mode 100644 models/qwen3-5-9b.yaml create mode 100644 providers/openinfer.yaml diff --git a/mappings/openinfer/llama-3-2-1b.yaml b/mappings/openinfer/llama-3-2-1b.yaml new file mode 100644 index 0000000..7774e60 --- /dev/null +++ b/mappings/openinfer/llama-3-2-1b.yaml @@ -0,0 +1,15 @@ +model_id: llama-3-2-1b +provider_id: openinfer +provider_model_name: "@oi/Llama-3.2-1B-Instruct" +pricing: + input_per_million: 0.00 + output_per_million: 0.00 + currency: USD +rate_limits: + requests_per_minute: 60 + tokens_per_minute: 100000 +context_window_override: null +available_regions: + - global +created_at: "2026-08-19T00:00:00.000Z" +updated_at: "2026-08-19T00:00:00.000Z" diff --git a/mappings/openinfer/qwen3-5-9b.yaml b/mappings/openinfer/qwen3-5-9b.yaml new file mode 100644 index 0000000..c8a891f --- /dev/null +++ b/mappings/openinfer/qwen3-5-9b.yaml @@ -0,0 +1,15 @@ +model_id: qwen3-5-9b +provider_id: openinfer +provider_model_name: "@oi/Qwen3.5-9B" +pricing: + input_per_million: 0.00 + output_per_million: 0.00 + currency: USD +rate_limits: + requests_per_minute: 60 + tokens_per_minute: 100000 +context_window_override: null +available_regions: + - global +created_at: "2026-08-19T00:00:00.000Z" +updated_at: "2026-08-19T00:00:00.000Z" diff --git a/models/llama-3-2-1b.yaml b/models/llama-3-2-1b.yaml new file mode 100644 index 0000000..a0d4966 --- /dev/null +++ b/models/llama-3-2-1b.yaml @@ -0,0 +1,13 @@ +id: llama-3-2-1b +name: Llama 3.2 1B Instruct +description: Meta's smallest open-weight model with 1 billion parameters from the Llama 3.2 family. Designed for on-device and edge deployment, supporting dialogue, summarization, rewriting, and instruction following with a 128K context window. +capabilities: + - chat + - completion +modalities: + - text +context_window: 131072 +licensing: other +country: us +created_at: "2026-08-19T00:00:00.000Z" +updated_at: "2026-08-19T00:00:00.000Z" diff --git a/models/qwen3-5-9b.yaml b/models/qwen3-5-9b.yaml new file mode 100644 index 0000000..f9cc9d6 --- /dev/null +++ b/models/qwen3-5-9b.yaml @@ -0,0 +1,20 @@ +id: qwen3-5-9b +name: Qwen 3.5 9B +description: Alibaba's compact 9 billion parameter multimodal model from the Qwen3.5 family. Hybrid architecture combining Gated Delta Networks and Gated Attention delivers a 262K native context window, text, image, and video understanding, and coverage of 201 languages. Strong reasoning and coding performance for its size, released under Apache 2.0. +capabilities: + - chat + - completion + - function-calling + - vision + - code-generation + - reasoning +modalities: + - text + - image + - video + - code +context_window: 262144 +licensing: apache-2.0 +country: cn +created_at: "2026-08-19T00:00:00.000Z" +updated_at: "2026-08-19T00:00:00.000Z" diff --git a/providers/openinfer.yaml b/providers/openinfer.yaml new file mode 100644 index 0000000..bf61708 --- /dev/null +++ b/providers/openinfer.yaml @@ -0,0 +1,14 @@ +id: openinfer +name: OpenInfer +description: >- + Hosted, OpenAI-compatible inference API serving popular open-source + models on OpenInfer OS. Routes every request across distributed + CPU, GPU, and NPU compute with SLA-aware routing and automatic + fallback for lower cost per token. +api_base_url: https://platform.openinfer.io/v1 +auth_type: bearer +regions: + - global +compatibility: openai +created_at: "2026-08-19T00:00:00.000Z" +updated_at: "2026-08-19T00:00:00.000Z" From 70ac66dec2011dea5650fe0fdd5afa399905f61b Mon Sep 17 00:00:00 2001 From: Onkar Patil Date: Wed, 19 Aug 2026 14:08:42 -0700 Subject: [PATCH 2/6] fix: correct OpenInfer API base URL to api.openinfer.ai Co-Authored-By: Claude Fable 5 --- providers/openinfer.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/providers/openinfer.yaml b/providers/openinfer.yaml index bf61708..66e1035 100644 --- a/providers/openinfer.yaml +++ b/providers/openinfer.yaml @@ -5,7 +5,7 @@ description: >- models on OpenInfer OS. Routes every request across distributed CPU, GPU, and NPU compute with SLA-aware routing and automatic fallback for lower cost per token. -api_base_url: https://platform.openinfer.io/v1 +api_base_url: https://api.openinfer.ai/v1 auth_type: bearer regions: - global From db25f5f13e93b09f61bfeed027a752a7dcb9d0f1 Mon Sep 17 00:00:00 2001 From: Onkar Patil Date: Tue, 8 Sep 2026 17:06:00 -0700 Subject: [PATCH 3/6] feat: add Qwen3.5 27B and Gemma 4 31B, set OpenInfer pricing Update the OpenInfer mappings with published rate-card pricing and extend coverage to two additional served models. Pricing (USD per 1M tokens, input/output): Qwen3.5 9B 0.15 / 0.18 Qwen3.5 27B 0.72 / 0.72 Llama3.2 1B 0.02 / 0.02 Gemma4 31B 0.52 / 0.75 Adds a canonical entry for Qwen 3.5 27B; Gemma 4 31B already exists upstream, so it needs only a mapping. Co-Authored-By: Claude Opus 5 (1M context) --- mappings/openinfer/gemma-4-31b.yaml | 15 +++++++++++++++ mappings/openinfer/llama-3-2-1b.yaml | 6 +++--- mappings/openinfer/qwen3-5-27b.yaml | 15 +++++++++++++++ mappings/openinfer/qwen3-5-9b.yaml | 6 +++--- models/qwen3-5-27b.yaml | 20 ++++++++++++++++++++ 5 files changed, 56 insertions(+), 6 deletions(-) create mode 100644 mappings/openinfer/gemma-4-31b.yaml create mode 100644 mappings/openinfer/qwen3-5-27b.yaml create mode 100644 models/qwen3-5-27b.yaml diff --git a/mappings/openinfer/gemma-4-31b.yaml b/mappings/openinfer/gemma-4-31b.yaml new file mode 100644 index 0000000..d49e255 --- /dev/null +++ b/mappings/openinfer/gemma-4-31b.yaml @@ -0,0 +1,15 @@ +model_id: gemma-4-31b +provider_id: openinfer +provider_model_name: "@oi/Gemma-4-31B-It" +pricing: + input_per_million: 0.52 + output_per_million: 0.75 + currency: USD +rate_limits: + requests_per_minute: 60 + tokens_per_minute: 100000 +context_window_override: null +available_regions: + - global +created_at: "2026-09-08T00:00:00.000Z" +updated_at: "2026-09-08T00:00:00.000Z" diff --git a/mappings/openinfer/llama-3-2-1b.yaml b/mappings/openinfer/llama-3-2-1b.yaml index 7774e60..8562bc6 100644 --- a/mappings/openinfer/llama-3-2-1b.yaml +++ b/mappings/openinfer/llama-3-2-1b.yaml @@ -2,8 +2,8 @@ model_id: llama-3-2-1b provider_id: openinfer provider_model_name: "@oi/Llama-3.2-1B-Instruct" pricing: - input_per_million: 0.00 - output_per_million: 0.00 + input_per_million: 0.02 + output_per_million: 0.02 currency: USD rate_limits: requests_per_minute: 60 @@ -12,4 +12,4 @@ context_window_override: null available_regions: - global created_at: "2026-08-19T00:00:00.000Z" -updated_at: "2026-08-19T00:00:00.000Z" +updated_at: "2026-09-08T00:00:00.000Z" diff --git a/mappings/openinfer/qwen3-5-27b.yaml b/mappings/openinfer/qwen3-5-27b.yaml new file mode 100644 index 0000000..31df717 --- /dev/null +++ b/mappings/openinfer/qwen3-5-27b.yaml @@ -0,0 +1,15 @@ +model_id: qwen3-5-27b +provider_id: openinfer +provider_model_name: "@oi/Qwen3.5-27B" +pricing: + input_per_million: 0.72 + output_per_million: 0.72 + currency: USD +rate_limits: + requests_per_minute: 60 + tokens_per_minute: 100000 +context_window_override: null +available_regions: + - global +created_at: "2026-09-08T00:00:00.000Z" +updated_at: "2026-09-08T00:00:00.000Z" diff --git a/mappings/openinfer/qwen3-5-9b.yaml b/mappings/openinfer/qwen3-5-9b.yaml index c8a891f..ef3fda9 100644 --- a/mappings/openinfer/qwen3-5-9b.yaml +++ b/mappings/openinfer/qwen3-5-9b.yaml @@ -2,8 +2,8 @@ model_id: qwen3-5-9b provider_id: openinfer provider_model_name: "@oi/Qwen3.5-9B" pricing: - input_per_million: 0.00 - output_per_million: 0.00 + input_per_million: 0.15 + output_per_million: 0.18 currency: USD rate_limits: requests_per_minute: 60 @@ -12,4 +12,4 @@ context_window_override: null available_regions: - global created_at: "2026-08-19T00:00:00.000Z" -updated_at: "2026-08-19T00:00:00.000Z" +updated_at: "2026-09-08T00:00:00.000Z" diff --git a/models/qwen3-5-27b.yaml b/models/qwen3-5-27b.yaml new file mode 100644 index 0000000..9df7df6 --- /dev/null +++ b/models/qwen3-5-27b.yaml @@ -0,0 +1,20 @@ +id: qwen3-5-27b +name: Qwen 3.5 27B +description: Alibaba's mid-size 27 billion parameter multimodal model from the Qwen3.5 family. Shares the hybrid architecture of its 9B sibling, combining Gated Delta Networks and Gated Attention for a 262K native context window, with text, image, and video understanding and coverage of 201 languages. Trades throughput for stronger reasoning, agentic tool use, and coding performance. Released under Apache 2.0. +capabilities: + - chat + - completion + - function-calling + - vision + - code-generation + - reasoning +modalities: + - text + - image + - video + - code +context_window: 262144 +licensing: apache-2.0 +country: cn +created_at: "2026-09-08T00:00:00.000Z" +updated_at: "2026-09-08T00:00:00.000Z" From 0a42383c9f9cf0233cd844ace8acc0660828b500 Mon Sep 17 00:00:00 2001 From: Onkar Patil Date: Tue, 8 Sep 2026 22:28:07 -0700 Subject: [PATCH 4/6] feat: record served context windows for OpenInfer mappings Set context_window_override to the context length each model is actually served at on OpenInfer nodes: Qwen3.5 27B 32768 Llama3.2 1B 16384 Gemma4 31B 32768 Qwen3.5 9B is served at its full native 262144 window, so its override stays null. Co-Authored-By: Claude Opus 5 (1M context) --- mappings/openinfer/gemma-4-31b.yaml | 2 +- mappings/openinfer/llama-3-2-1b.yaml | 2 +- mappings/openinfer/qwen3-5-27b.yaml | 2 +- 3 files changed, 3 insertions(+), 3 deletions(-) diff --git a/mappings/openinfer/gemma-4-31b.yaml b/mappings/openinfer/gemma-4-31b.yaml index d49e255..c8b1124 100644 --- a/mappings/openinfer/gemma-4-31b.yaml +++ b/mappings/openinfer/gemma-4-31b.yaml @@ -8,7 +8,7 @@ pricing: rate_limits: requests_per_minute: 60 tokens_per_minute: 100000 -context_window_override: null +context_window_override: 32768 available_regions: - global created_at: "2026-09-08T00:00:00.000Z" diff --git a/mappings/openinfer/llama-3-2-1b.yaml b/mappings/openinfer/llama-3-2-1b.yaml index 8562bc6..38c0238 100644 --- a/mappings/openinfer/llama-3-2-1b.yaml +++ b/mappings/openinfer/llama-3-2-1b.yaml @@ -8,7 +8,7 @@ pricing: rate_limits: requests_per_minute: 60 tokens_per_minute: 100000 -context_window_override: null +context_window_override: 16384 available_regions: - global created_at: "2026-08-19T00:00:00.000Z" diff --git a/mappings/openinfer/qwen3-5-27b.yaml b/mappings/openinfer/qwen3-5-27b.yaml index 31df717..8ca6606 100644 --- a/mappings/openinfer/qwen3-5-27b.yaml +++ b/mappings/openinfer/qwen3-5-27b.yaml @@ -8,7 +8,7 @@ pricing: rate_limits: requests_per_minute: 60 tokens_per_minute: 100000 -context_window_override: null +context_window_override: 32768 available_regions: - global created_at: "2026-09-08T00:00:00.000Z" From 9aa140f620a6799f553d52a3cb3dd8918a754a1d Mon Sep 17 00:00:00 2001 From: Onkar Patil Date: Tue, 8 Sep 2026 23:11:27 -0700 Subject: [PATCH 5/6] fix: correct Gemma4 31B served context window to 8192 Gemma4 31B is served at 8192 tokens on OpenInfer nodes, not 32768. Co-Authored-By: Claude Opus 5 (1M context) --- mappings/openinfer/gemma-4-31b.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/mappings/openinfer/gemma-4-31b.yaml b/mappings/openinfer/gemma-4-31b.yaml index c8b1124..23bca2d 100644 --- a/mappings/openinfer/gemma-4-31b.yaml +++ b/mappings/openinfer/gemma-4-31b.yaml @@ -8,7 +8,7 @@ pricing: rate_limits: requests_per_minute: 60 tokens_per_minute: 100000 -context_window_override: 32768 +context_window_override: 8192 available_regions: - global created_at: "2026-09-08T00:00:00.000Z" From 1efa0be2a476ee15918220bdc8a195de22711b38 Mon Sep 17 00:00:00 2001 From: Onkar Patil Date: Wed, 9 Sep 2026 09:46:49 -0700 Subject: [PATCH 6/6] fix: correct served context windows for Llama3.2 1B and Qwen3.5 9B Llama3.2 1B is served at 24000 tokens, not 16384. Qwen3.5 9B is served at 65536 rather than its full native 262144 window, so it now carries an explicit override instead of null. Co-Authored-By: Claude Opus 5 --- mappings/openinfer/llama-3-2-1b.yaml | 2 +- mappings/openinfer/qwen3-5-9b.yaml | 2 +- 2 files changed, 2 insertions(+), 2 deletions(-) diff --git a/mappings/openinfer/llama-3-2-1b.yaml b/mappings/openinfer/llama-3-2-1b.yaml index 38c0238..e1c3e71 100644 --- a/mappings/openinfer/llama-3-2-1b.yaml +++ b/mappings/openinfer/llama-3-2-1b.yaml @@ -8,7 +8,7 @@ pricing: rate_limits: requests_per_minute: 60 tokens_per_minute: 100000 -context_window_override: 16384 +context_window_override: 24000 available_regions: - global created_at: "2026-08-19T00:00:00.000Z" diff --git a/mappings/openinfer/qwen3-5-9b.yaml b/mappings/openinfer/qwen3-5-9b.yaml index ef3fda9..df712dc 100644 --- a/mappings/openinfer/qwen3-5-9b.yaml +++ b/mappings/openinfer/qwen3-5-9b.yaml @@ -8,7 +8,7 @@ pricing: rate_limits: requests_per_minute: 60 tokens_per_minute: 100000 -context_window_override: null +context_window_override: 65536 available_regions: - global created_at: "2026-08-19T00:00:00.000Z"