> ## Documentation Index
> Fetch the complete documentation index at: https://wb-21fd5541-workspaces-notebooks.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 利用可能なモデル

> Serverless Inference で利用できる基盤モデルを確認


Serverless Inference では、複数のオープンソース基盤モデルを利用できます。各モデルには、それぞれ異なる強みとユースケースがあります。

<div id="generally-available-models">
  ## 一般提供されているモデル
</div>

次のモデルは[一般提供](/ja/inference/lifecycle#model-lifecycle-stages)されています：

| モデル                           | モデル ID (API 使用時)                               | タイプ       | コンテキストウィンドウ | パラメーター               | 説明                                                                                                     |
| ----------------------------- | ---------------------------------------------- | --------- | ----------- | -------------------- | ------------------------------------------------------------------------------------------------------ |
| DeepSeek V4-Flash-0731        | `deepseek-ai/DeepSeek-V4-Flash-0731`           | テキスト      | 262k        | 13B-284B (アクティブ-合計)  | DeepSeek V4-Flash-0731 は、コーディング、推論、エージェント型ワークロードに適した MoE モデルです。                                        |
| DeepSeek V4-Pro-0813          | `deepseek-ai/DeepSeek-V4-Pro-0813`             | テキスト      | 1049k       | 49B-1.6T (アクティブ-合計)  | DeepSeek V4-Pro-0813は、1.6TパラメーターのMoEモデルで、高度な推論、コーディング、複雑なエージェント型ワークロードに優れています。                         |
| DeepSeek V3.1                 | `deepseek-ai/DeepSeek-V3.1`                    | テキスト      | 161k        | 37B-671B (アクティブ-合計)  | プロンプトテンプレートを通じて、思考モードと思考なしモードの両方をサポートする大規模なハイブリッドモデル。                                                  |
| Google Gemma 4 31B            | `google/gemma-4-31B-it`                        | テキスト、画像   | 262k        | 31B (合計)             | Gemma 4 31B Dense は、高度な推論、エージェント型ワークフロー、長いコンテキストに対応するよう設計されており、140 以上の言語でネイティブにトレーニングされています。           |
| IBM Granite 4.2 8B            | `ibm-granite/granite-4.2-8b`                   | テキスト      | 131k        | 8B (合計)              | Granite 4.2 8B は、強化されたツール呼び出し、指示追従、チャット機能を備えた Instruct モデルです。                                          |
| Meta Llama 3.3 70B            | `meta-llama/Llama-3.3-70B-Instruct`            | テキスト      | 128k        | 70B (合計)             | 会話タスク、詳細な指示への追従、コーディングに優れた多言語モデル。                                                                      |
| Meta Llama 3.1 8B             | `meta-llama/Llama-3.1-8B-Instruct`             | テキスト      | 131k        | 8B (合計)              | 応答性の高い多言語チャットボット向けに最適化された、効率的な会話モデル。                                                                   |
| MiniMax M3                    | `MiniMaxAI/MiniMax-M3`                         | テキスト、画像   | 262k        | 23B-428B (アクティブ-合計)  | MiniMax M3 は、23B のアクティブパラメーターを備え、コーディングやエージェント型ワークフロー向けに最適化されたマルチモーダル MoE モデルです。                       |
| Moonshot AI Kimi K2.7 Code    | `moonshotai/Kimi-K2.7-Code`                    | テキスト、画像   | 262k        | 32B-1T (アクティブ-合計)    | Kimi K2.7 Code は、320億のアクティブパラメーターと合計1兆のパラメーターを備え、長期間にわたるエージェント型コーディングとソフトウェアエンジニアリング向けに特化した MoE モデルです。 |
| Moonshot AI Kimi K2.6         | `moonshotai/Kimi-K2.6`                         | テキスト、画像   | 262k        | 32B-1T (アクティブ-合計)    | Kimi K2.6 は、320億のアクティブパラメーターと合計1兆のパラメーターを備えた、マルチモーダルのMixture-of-Experts言語モデルです。                        |
| NVIDIA Nemotron 3.5 Lightning | `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B` | テキスト      | 262k        | 3B-30B (アクティブ-合計)    | Nemotron 3.5 Lightning は、金融サービス、サイバーセキュリティ、通信、小売などのユースケースにおいて、高速かつ信頼性の高いエージェント型タスク向けに構築された MoE モデルです。  |
| NVIDIA Nemotron 3 Ultra       | `nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B`     | テキスト      | 262k        | 55B-550B (アクティブ-合計)  | Nemotron 3 Ultra は、コーディング、ディープリサーチ、エンタープライズオートメーションにおける長時間動作するエージェント向けに設計された、強力な MoE モデルです。            |
| OpenAI GPT OSS 120B           | `openai/gpt-oss-120b`                          | テキスト      | 131k        | 5.1B-117B (アクティブ-合計) | 高度な推論、エージェント型、および汎用のユースケース向けに設計された、効率的なMixture-of-Expertsモデル。                                          |
| OpenAI GPT OSS 20B            | `openai/gpt-oss-20b`                           | テキスト      | 131k        | 36億～200億 (アクティブ～総計)  | OpenAIのHarmonyレスポンス形式でトレーニングされた、推論能力を備える低レイテンシのMixture-of-Expertsモデル。                                  |
| Qwen3.8 27B                   | `Qwen/Qwen3.8-27B`                             | テキスト、ビジョン | 262k        | 27B (合計)             | Qwen3.8-27B は、コーディング、研究、ビジョン、長時間にわたるエージェントタスクに適した高密度マルチモーダルモデルです。                                      |
| Qwen3.6 35B A3B               | `Qwen/Qwen3.6-35B-A3B`                         | テキスト、ビジョン | 262k        | 3B-35B (アクティブ-総計)    | Qwen3.6-35B-A3B は、エージェント型コーディングワークフロー向けに最適化された、262K コンテキストの MoE マルチモーダルモデルです。                          |
| Z.AI GLM 5.3 Flash            | `zai-org/GLM-5.3-Flash`                        | テキスト、ビジョン | 1049k       | 18B-320B (アクティブ-合計)  | GLM-5.3-Flash は、合計3,200億個のパラメーターと180億個の実行中パラメーターを備えた、ネイティブにマルチモーダルなモデルです。                              |
| Z.AI GLM 5.2                  | `zai-org/GLM-5.2`                              | テキスト      | 1049k       | 40B-744B (アクティブ-合計)  | GLM-5.2 は、400億のアクティブパラメーターと合計7,440億のパラメーターを備えたMixture-of-Experts言語モデルです。                               |

<div id="experimental-models">
  ## 実験的なモデル
</div>

以下のモデルは[実験的](/ja/inference/lifecycle#model-lifecycle-stages)です：

*現在のところありません*

<div id="deprecated-models">
  ## 非推奨のモデル
</div>

以下のモデルは[非推奨](/ja/inference/lifecycle#model-lifecycle-stages)です。

| モデル                         | モデル ID (API で使用)                       | タイプ       | コンテキストウィンドウ | パラメーター                | 説明                                                                                                    |
| --------------------------- | -------------------------------------- | --------- | ----------- | --------------------- | ----------------------------------------------------------------------------------------------------- |
| DeepSeek V4-Flash           | `deepseek-ai/DeepSeek-V4-Flash`        | テキスト      | 1049k       | 13B-284B (アクティブ-合計)   | DeepSeek V4-Flash は 100 万コンテキスト長の MoE モデルで、コーディング、推論、エージェント型ワークロードに優れています。                            |
| DeepSeek V4-Pro             | `deepseek-ai/DeepSeek-V4-Pro`          | テキスト      | 1049k       | 49B-1.6T (アクティブ-合計)   | DeepSeek V4-Pro は 49B のアクティブパラメーターを持つ 1.6T パラメーターの MoE モデルで、高度な推論、コーディング、複雑なエージェント型ワークロードに優れています。     |
| IBM Granite 4.1 8B          | `ibm-granite/granite-4.1-8b`           | テキスト      | 131k        | 8B (合計)               | Granite 4.1 8B はロングコンテキスト対応の instruct モデルで、強化されたツール呼び出し、指示追従、チャットの各機能を備えています。                         |
| JetBrains Mellum2 12B A2.5B | `JetBrains/Mellum2-12B-A2.5B-Instruct` | テキスト      | 131k        | 2.5B-12B (アクティブ-合計)   | Mellum2-12B-A2.5B-Instruct は 131K コンテキストを備えた高速な MoE モデルで、コーディング、ツールの使用、低レイテンシーの AI ワークフロー向けに構築されています。 |
| Meta Llama 3.1 70B          | `meta-llama/Llama-3.1-70B-Instruct`    | テキスト      | 131k        | 70B (合計)              | 応答性の高い多言語チャットボット対話向けに最適化された、効率的な会話モデルです。                                                              |
| OpenPipe Qwen3 14B Instruct | `OpenPipe/Qwen3-14B-Instruct`          | テキスト      | 32.8k       | 14.8B (合計)            | ファインチューニングによるエージェント構築向けに OpenPipe が最適化した、効率的で多言語対応の密なインストラクションチューニング済みモデルです。                          |
| Qwen3.6 27B                 | `Qwen/Qwen3.6-27B`                     | テキスト、ビジョン | 262k        | 27B (合計)              | Qwen3.6-27B は 262K コンテキストを備えた 27B の密なマルチモーダルモデルで、フラッグシップレベルのエージェント型コーディング向けに構築されています。                 |
| Qwen3.5 35B A3B             | `Qwen/Qwen3.5-35B-A3B`                 | テキスト、ビジョン | 262k        | 3B-35B (アクティブ-合計)     | Qwen3.5-35B-A3B はオープンウェイトのマルチモーダル MoE モデルで、チャット、推論、エージェント型タスクにわたり効率的で高スループットな推論を実現するように構築されています。      |
| Qwen3 30B A3B               | `Qwen/Qwen3-30B-A3B-Instruct-2507`     | テキスト      | 262k        | 3.3B-30.5B (アクティブ-合計) | Qwen3-30B-A3B-Instruct-2507 は 30.5B の MoE インストラクションチューニング済みモデルで、推論、コーディング、ロングコンテキスト理解が強化されています。       |

<div id="use-model-ids">
  ## モデル ID を使用する
</div>

API を呼び出してモデルを指定するには、前述の表にある `Model ID` を使用します。たとえば:

```python theme={null}
response = client.chat.completions.create(
    model="meta-llama/Llama-3.1-8B-Instruct",
    messages=[...]
)
```

<div id="next-steps">
  ## 次のステップ
</div>

モデルを選択したら、次のいずれかのリソースを参照してください。

* 各モデルの[利用制限と料金](/ja/inference/usage-limits/)を確認してください。
* これらのモデルの使い方については、[API リファレンス](/ja/inference/api-reference/)を参照してください。
* [W\&B Playground](/ja/inference/ui-guide/)でモデルを試してください。
