Jev は TypeSafe AI による System One シリーズ初のモデルで、生成された散文ではなく構造化された判断を必要とするアプリケーション向けに設計されています。提供された情報を明確に定義された質問に照らして評価し、型付きの回答、確率分布、該当する場合は信頼度スコアを返します。
従来の大規模言語モデルとは異なり、Jev はチャット、コード作成、長文コンテンツの生成を目的としていません。分類、ルーティング、スコアリング、検証、優先順位付け、ワークフロー制御のためにソフトウェアが即座に利用できる範囲内の判断を行うことが目的です。
モデル情報は 2026年9月21日にレビューされました。
Jev の技術仕様
| 仕様 | 詳細 |
|---|---|
| 開発元 | TypeSafe AI |
| モデルファミリー | System One |
| 現行安定版 | Jev 1.13 |
| バージョン付きモデル ID | jev-1.13.0 |
| 安定版エイリアス | jev-latest |
| 入力 | テキスト、JSON オブジェクト、またはテキスト配列 |
| 出力 | 型付きの判断と確率分布 |
| 質問タイプ | Choice、Score、Noul |
| コンテキスト上限 | リクエストあたり 64,000 トークン |
| 追加コンテキスト制約 | 状態と最長の質問あわせて 32,000 トークン |
| 公開入力価格 | 100万トークンあたり $0.042 |
| 公開出力価格 | 無料 |
| 公開レート制限 | 1 秒あたり 250,000 トークン、1 分あたり 1,200 リクエスト |
| 主要言語 | 英語 |
| 直接のマルチモーダル入力 | 未対応 |
価格、エイリアス、レート制限は変更される場合があります。運用投入前に最新情報を確認してください。
Jev とは?
Jev は TypeSafe AI によって開発された意思決定モデルです。オープンエンドなトークン列を生成する代わりに、開発者が定義した回答空間から値を選択します。
Jev のリクエストは 2 つの主要コンポーネントで構成されます。
- State: サポートチケット、取引記録、エージェントのトレース、製品説明、JSON 形式のアプリケーション状態など、モデルが評価すべき情報
- Questions: その状態に対して下すべき判断の型付き定義
得られる回答はソフトウェアでの直接利用を意図しています。アプリケーションは選択されたカテゴリで分岐したり、スコアを比較したり、確率を検査したり、信頼度のしきい値を適用したり、不確実なケースを人間の審査に回すことができます。
したがって Jev は、アプリケーションデータと決定論的なビジネスロジックの間にある確率的な意思決定レイヤーとして機能します。固定ルールでは表現しづらい判断を処理しつつ、アプリケーションコード側がしきい値、権限、アクションの制御を保持できるようにします。
Jev の動作
3 つの意思決定プリミティブ
Jev は、異なる種類のソフトウェア判断に対応する 3 つの質問タイプをサポートします。
Choice は、あらかじめ定義された選択肢から 1 つを選びます。意図分類、チケットのルーティング、ポリシー分類、モデル選択などに適しています。応答には選択結果、各選択肢に割り当てられた確率、信頼度スコアが含まれます。
Score は、順序付きルーブリックに照らして状態を評価します。緊急度、リスク、関連性、フラストレーション、コンテンツ品質などを測定できます。応答にはスコア、各ルーブリック水準の確率、信頼度スコアが含まれます。
Noul は、ある主張が真である確率を推定します。0〜1 の値を返し、検証、ポリシーチェック、適格性判断、完了ゲートに有用です。Choice や Score と異なり、Noul は出力自体が確率であるため、別個の信頼度フィールドは返しません。
質問の並列評価
1 回のリクエストに複数の Choice、Score、Noul 質問を含めることができ、Jev はそれらを同一の状態に対して独立かつ並列に評価します。
たとえば、サポートプラットフォームは 1 回のリクエストでチケットを分類し、緊急度を評価し、人手によるエスカレーションが必要かどうかを推定できます。TypeSafe は、独立した質問を追加しても応答時間への影響は小さいと述べています。
同一リクエスト内の質問同士が互いの回答に依存することはできません。逐次的な判断は、アプリケーションロジックで接続された個別の呼び出しとして実装してください。
型安全な応答
Jev の可能な応答構造は推論前に定義されます。これにより、カテゴリや数値が必要な箇所に不正な JSON、予期しないフィールド、説明文が紛れ込むことを防ぎます。
型安全性はあくまで応答フォーマットを保証するものです。Jev は依然として形式的には正しいが判断としては誤りとなる結果を返す可能性があるため、本番チームは代表的データで精度を評価する必要があります。
明示的な確率と信頼度
Choice と Score は、それぞれの回答の背後にある確率分布を公開します。信頼度の値は、その分布がどれほど強く 1 つの結果を支持しているかを要約したものです。
アプリケーションは、信頼度を使って明確な判断は自動化し、不確実性が中程度の場合は確認を求め、曖昧なケースは人間やフォールバックモデルに回すことができます。
適切なしきい値はリスクに依存します。サポートチケットのタグ付けは、取引の承認や不可逆的なアクションの実行よりも不確実性を許容できます。
低レイテンシ推論
TypeSafe は、エンドツーエンドの応答時間が約 70〜500 ミリ秒であると報告しています。これにより、インタラクティブなルーティング、繰り返し行うエージェントチェック、生成モデルの呼び出しが応答性に影響し得るような意思決定の多いワークフローに適しています。
実際のレイテンシは、状態サイズ、サービス負荷、ネットワーク状況、デプロイ地域に依存します。
リクエスト単位のカスタマイズ
Jev は、アカウント固有のファインチューニングや LoRA アダプタによるカスタマイズを行いません。開発者は、関連する状態の提供、精密な指示の記述、明確な基準の定義、アプリケーションコードでの原子的な判断の組み合わせによって適応させます。
このアプローチにより、ビジネスルールが可視化され、モデルの再学習なしにチームがワークフローのロジックを変更できます。
バージョン付きモデルと安定エイリアス
TypeSafe は固定のモデル ID と可動のエイリアスを提供します。jev-1.13.0 は特定のリリースを識別し、jev-latest は最新の安定版を指します。jev-preview は、新しいプレビュー版が利用可能になった際により新しいプレビューに移行する場合があります。
エイリアスは実験を容易にしますが、更新後に動作が変わる可能性があります。校正したしきい値で運用するアプリケーションは、テスト済みのバージョンに固定し、各応答で返されるモデル ID を記録してください。
Jev のベンチマーク性能
Jev は、ライティング、コーディング、数学的導出、長文推論に焦点を当てた汎用ベンチマーク向けに設計されていません。より関連する測定項目は、判断品質、確率の較正、レイテンシ、コスト、出力信頼性です。
TypeSafe の報告:
- エンドツーエンド応答時間 70〜500 ミリ秒
- 同等の System One タスクで約 40〜200× の高速実行
- ワークフローのピーク結果で 193.6× の高速化
- 報告されたコスト改善のピークで 444.6×
これらはベンダーの報告であり、普遍的な性能保証として扱うべきではありません。TypeSafe のワークフロー評価は、構造化された意思決定グラフ上でモデルを比較し、選定した高性能外部モデルの平均予測を参照確率として使用しています。
また TypeSafe は、評価されたワークフローが同社のモデル機能チームのメンバーによって作成されたことを認めており、バイアスを導入する可能性があります。報告された利得は、アプリケーションが観測し得る値の上限に近いと考えられます。
Jev vs 構造化出力 LLM vs 従来型分類器 vs ルールエンジン
| 観点 | Jev | 構造化出力 LLM | 従来型分類器 | ルールエンジン |
|---|---|---|---|---|
| 主機能 | 有界な確率的判断 | 構造化レスポンスを伴う生成 | 学習済みタスクに対する予測 | 決定論的ロジック |
| 回答空間 | 各リクエストで定義 | スキーマによる制約 | 学習時に固定 | コードで固定 |
| 不確実性 | ネイティブな確率と信頼度 | モデルと手法に依存 | 利用可能な場合が多いが較正が必要なことも | 既定では確率的でない |
| 出力構造 | 対応プリミティブで保証 | 通常は制約生成と検証が必要 | 実装に依存 | 実装に依存 |
| 新タスクの立ち上げ | 状態、質問、基準を定義 | プロンプトとスキーマを作成 | ラベル付きデータ収集とモデル学習 | 明示的な条件を記述 |
| オープンエンド生成 | いいえ | はい | いいえ | いいえ |
| 拡張推論 | 対象ワークロードではない | 高性能モデルで対応 | いいえ | エンコードされたロジックに限定 |
| 適応 | リクエスト単位の指示と基準 | プロンプトおよびコンテキスト変更 | 再学習または特徴量設計 | コード変更 |
| 最適な用途 | ソフトウェア内の高頻度な判断 | 推論と生成を組み合わせるタスク | 安定・狭域・データ豊富な予測 | 明示的で安定した条件 |
Jev は、固定ルールが脆弱すぎ、専用の分類器を作ると高コストで、アプリケーションが生成テキストを必要としない場合に最も有用です。
タスクに調査、説明、コンテンツ作成、計画、マルチステップ推論が必要な場合は、従来型の LLM がより適しています。条件がすでに明示的かつ決定論的である場合は、ルールエンジンが引き続き望ましい選択です。
推奨ユースケース
Jev は、あらかじめ定義された回答空間を持つ頻出の判断に最適です。
- ルーティングとトリアージ: リクエストを分類し、キューやツールを選択し、緊急ケースを優先します。
- エージェント制御: タスク完了の確認、提案アクションの評価、確認が必要なケースの特定を行います。
- LLM 評価: 関連性、エビデンスの裏付け、ポリシー順守、応答品質を評価します。
- モデレーション: ポリシー違反を分類し、重大度をスコアリングし、不確実なケースをエスカレーションします。
- データエンリッチメント: メッセージ、レビュー、リード、レコードをカテゴリ、スコア、確率特徴量に変換します。
- リアルタイム意思決定: 生成的な応答が不要な低レイテンシなアプリケーション動作を支援します。
Jev の制約
Jev は意図的に特化されており、その狭い設計にはいくつかの重要な制約があります。
- 散文、コード、要約、会話的な回答を生成できません。
- 長時間の調査やマルチステップ推論を意図していません。
- 型安全な出力は正しいビジネス判断を保証しません。
- 画像、音声、動画、バイナリファイルは、送信前にテキストまたは構造化データに変換する必要があります。
- 英語での性能が最も良好と文書化されています。
- 英語以外および CJK のワークロードは個別評価が必要です。
- 同一リクエスト内の質問は独立に評価されます。
- それらの質問間で逐次的な推論チェーンを構築できません。
- TypeSafe はモデルのパラメータ数を開示しておらず、重みも公開していません。
- カスタマイズは顧客固有のファインチューニングではなく、リクエストを通じて行います。
- 公開されている性能向上は TypeSafe 独自の評価フレームワークによるものです。
- 移動エイリアスにより、アプリケーションコードを変更せずに動作が変わる可能性があります。
Jev は、権限、金額計算、法的要件、ファイルサイズ制限、不可逆アクションのポリシーなどの決定論的コードの代替にはすべきではありません。確率的モデルは、不確実な判断に有用であり、ソフトウェアがすでに正確に評価できる条件には適しません。
CometAPI はどのように Jev API へのアクセスを提供しますか?
Jev は現在、CometAPI の公開モデルカタログでは利用できません。CometAPI は、モデルへのアクセスが可能になり必要な接続権限が開放され次第、Jev を評価して統合する計画です。
統合後、開発者は CometAPI のモデルディレクトリと API ドキュメントで、サポートされるモデル ID、リクエスト形式、価格、レート制限、エンドポイント可用性を確認できるようになります。
正式な統合が発表されるまでは、Jev へのアクセスに TypeSafe のコンソール、ネイティブ API、または公式 SDK を使用してください。Jev が公開モデルカタログに掲載され、API 情報が検証されるまでは、CometAPI 統合が利用可能と見なすべきではありません。