TL;DR
Jev は TypeSafe AI によって開発された意思決定モデルです。TypeSafe は 2026年9月15日に、最初の System One モデルとして Jev を発表しました。Jev はソフトウェアが直接利用できる構造化された決定と確率を返すよう設計されています。本ガイドは主に TypeSafe の公式ドキュメント、クイックスタート、モデルリファレンス、および同社の Jev の公式発表に基づいています。
Jev は文章を書かず、コードを生成せず、会話もしません。テキストベースの状態を型付きの質問に照らして評価し、アプリケーションが直接利用できる構造化された回答を返します。
この違いはソフトウェアのワークフローにおいて重要です。従来の大規模言語モデルは、アプリケーションがカテゴリー、スコア、Yes/No だけを必要とする場合でもトークンを生成します。Jev は決定そのものを中心に設計されています。インターフェースは状態と複数の質問を受け取り、型付きの値と確率分布を返します。Choice と Score の回答には信頼度も含まれます。
Jev は分類、ルーティング、スコアリング、検証、ガードレールなどの限定された決定を想定しています。GPT、Claude、Gemini などの生成モデルの一般的な代替ではありません。AI エージェントでは、生成モデルが計画やコンテンツ生成を担い、Jev がルート選択、リスク確認、レビュー要否判断など頻出の決定を処理します。
重要なポイント
- Jev は TypeSafe によって開発され、同社のフラグシップ System One モデルとして提示されています。
- モデルはテキストベースの状態と型付きの質問を受け取り、生成文ではなく構造化された決定を返します。
- Jev は Choice、Score、Noul の 3 種類の質問をサポートします。
- 複数の質問を 1 回のリクエストで同じ状態に対して独立に並列評価できます。
- TypeSafe は RLCD(Reinforcement Learning for Calibrated Decisions)で Jev を学習します。
- 現在の公式モデルページには Jev 1.13 が記載され、リクエスト上限は 64,000 トークン、入力はテキストのみです。
- 公式価格は入力トークン 100 万あたり $0.042。出力トークンは無料と記載されています。
- 型安全な出力はスキーマ不一致を防ぎますが、あらゆる業務判断の正確性を保証するものではありません。
- TypeSafe は 70~500 ミリ秒のレイテンシと、自社ワークフロー評価での大きな改善を報告しています。これらはベンダー公表の数値で、System One 形のタスクに適用されます。
Jev とは?
Jev は TypeSafe AI が構築した意思決定モデルです。公式ドキュメントでは、同社のフラグシップかつ最初の System One モデルと記されています。入力は 2 つの主要構成からなります。
1 つ目は状態(state)です。状態とは、Jev が参照すべき情報で、顧客のメッセージ、インシデント報告、レコードの集合、アプリケーションのコンテキストを含む JSON オブジェクトなどが該当します。
2 つ目は型付きの質問の集合です。各質問は下すべき判断と許容される回答形式を定義します。Jev は状態に対して質問を評価し、コードが分岐・並べ替え・スコアリング・ルーティングに利用できる結果を返します。
例えば、支払い統合が 3 日間失敗しているというサポート依頼を考えます。サポートシステムは状況説明の段落ではなく、次のような 3 つの狭い決定を必要とするかもしれません。
- どのチームにチケットを割り当てるべきか?
- 顧客のフラストレーションはどの程度か?
- メッセージは緊急の対応を要するか?
Jev はこれらを 1 回のリクエストで、Choice、Score、Noul の質問として表現できます。応答には、選ばれたカテゴリーやスコア、関連する確率分布、そしてサポートされる場合は信頼度が含まれます。アプリケーションはこれらの値を用いて次の動作を決定します。
この職責分担は意図的です。モデルは安定した形式で不確実な判断を供給します。閾値、権限、副作用、フォールバックの挙動はアプリケーション側のコードが保持します。
System One モデルとは?
TypeSafe は、ソフトウェアが消費できる迅速で構造化された決定を行うモデル群を System One モデルと呼びます。この名称はダニエル・カーネマンの研究に関連する「速い思考と遅い思考」の区別に着想を得ています。人間の認知を再現するという主張ではなく、モデルの想定役割を説明します。
System One タスクは目的が限定されています。十分なコンテキストがあれば、知見のあるレビュー担当者が迅速に判断できるものです。例として、インテントの選択、定義済みスケールでの緊急度評価、主張の支持可否の確認、エスカレーション要否の判断などが挙げられます。
長い調査、多段の推論、長文説明、コンテンツ生成を要するタスクは適合しません。TypeSafe は幅広い判断を原子的な質問に分解し、その結果をコードで組み合わせることを推奨しています。
例えば「このスタートアップのピッチを評価せよ」は、検証可能な決定にするには広すぎます。市場規模、技術的実現性、差別化などを別個の質問として評価し、アプリケーションが明示的な数式でそれらを統合できます。事業の優先度が変われば、重みはコードで変更でき、モデルのプロンプトが隠れたビジネスロジックになることを防げます。
Jev はどう機能するか?
Jev の動作契約は次のように表せます。
State + typed questions -> typed decisions + probabilities
これは通常の言語モデルのフローとは異なります。
Prompt -> generated tokens -> parsing and validation -> application decision
違いは応答形式だけではありません。従来の構造化出力は、生成モデルにスキーマへ適合するトークン列を生成させます。Jev はあらかじめ定義された回答空間から値を返すよう設計されています。
現行の API は、状態を文字列、JSON オブジェクト、テキスト値の配列として受け入れます。入力はテキストのみです。画像、音声、動画、バイナリ文書は送信前にテキストや構造化フィールドへ変換する必要があります。
1 回のリクエスト内の各質問は、同じ状態に対して独立に評価されます。TypeSafe のドキュメントによれば、質問は並列評価されるため、質問数を追加しても応答時間はほとんど変化しません。独立性により、同一呼び出し内である質問の回答が別の質問のコンテキストになることも防がれます。
この挙動は重要な設計上の帰結を持ちます。ある決定が本当に別の決定に依存する場合、その依存関係はアプリケーションのワークフロー側に置くべきです。まず最初の評価を実行し、状態を更新するかコードで分岐し、その後に次の評価を実施します。単一リクエストは、証拠を共有しつつ互いの回答に依存しない質問に最適です。
Jev の 3 種類の質問
Jev は 3 つの基本プリミティブを提供します。それぞれが異なる種類のソフトウェア判断に対応します。
| 質問タイプ | 目的 | 返却内容 | 適用例 |
|---|---|---|---|
| Choice | 定義済み集合から 1 つの選択肢を選ぶ | 選択肢、各選択肢の確率、信頼度 | インテント分類、チームルーティング、モデル選択 |
| Score | 順序づけられたルーブリックで評価する | スコア、レベルごとの確率、信頼度 | 緊急度、品質、リスク、購買意図 |
| Noul | ある陳述が真である確率を推定する | 0 ~ 1 の値 | ポリシーチェック、完了チェック、二値の適格性判断 |
Choice
Choice 質問は、アプリケーションが定義した基準から 1 つの選択肢を選びます。サポートのワークフローなら billing、technical、sales と各カテゴリの説明を提供できます。Jev は選択されたオプション、各オプションに割り当てた確率、そして分布の形状から導出される信頼度を返します。
カテゴリ設計は結果の有用性に影響します。オーバーラップする選択肢はあいまいさを生みます。欠落した選択肢は不適合な回答へモデルを追いやります。プロダクションのタクソノミーには、不確実性を保持する必要がある場合に備え、insufficient_evidence や human_review のようなルートを含めるべきです。
設問文も実際の決定に一致すべきです。最初にどのチームが調査すべきかは暫定的なルーティングを求めます。どのチームが障害を引き起こしたかは原因診断を求めます。同じチーム一覧を用いても、尋ねていることは異なります。
Score
Score 質問は、状態を順序づけられたルーブリックに沿って配置します。基準は calm、frustrated、angry のようなレベルを記述しても、より詳細なビジネススケールを定義しても構いません。応答には数値スコア、数値とレベルを結び付ける凡例、各レベルに対する確率分布、信頼度が含まれます。
有用な Score のルーブリックは観察可能な差異を記述します。定義のないラベルは、モデルと人間のレビュアーに異なる基準を推測させます。リスクスケールは各レベルを隔てる条件を明記すべきです。品質スケールは、どの要件が満たされ、どれが欠けているかを明示すべきです。
独立した関心事を混ぜたスコアは分割した方がよいです。関連性、事実の裏付け、トーン、ポリシー準拠は別々の質問にできます。アプリケーションコードは、可視かつテスト可能な重みで合成スコアを計算できます。
Noul
Noul は TypeSafe の二値判断プリミティブです。ある陳述が真である確率を推定し、0 から 1 の値を返します。0.9 は 0.6 よりも高い真確率の推定を表します。
Noul には Choice と Score にある別個の confidence フィールドはありません。出力そのものが、評価対象の陳述が真である確率です。したがって質問は、メッセージが緊急性を伝えている、あるいは回答が提供されたソースにより裏付けられている、のようにテスト可能な陳述として書くべきです。
Noul は検証やゲート処理に有用ですが、閾値の設定はアプリケーション側の責任です。低リスクの UI 提案では低めの閾値を許容できる一方、取り消せない財務・管理アクションではより高い閾値が必要です。
原子的な質問と合成ワークフロー
Jev は各質問が 1 つの狭い事柄を問うときに最良に機能します。この設計により出力は検証しやすくなり、最終的なポリシーをソフトウェア側で保持できます。
たとえばエージェントがツール呼び出しを実行すべきか判断する必要があるとします。「このアクションを実行すべきか」という広い質問は、権限、可逆性、データの機微、ユーザー意図、運用リスクを混在させるかもしれません。より検証可能なワークフローは、これらの次元を別々に評価します。
- ツール呼び出しはユーザーのリクエストと整合しているか?
- 機微情報を送信するか?
- アクションは破壊的か、または元に戻しにくいか?
- 外部アカウントに影響するか?
- ポリシーで追加の確認が求められるか?
その後、制御ロジックが決定的なルールで回答を組み合わせます。破壊的な操作は、モデルの全体信頼度に関わらず確認を必須にできます。読み取り専用の操作は、より緩やかな経路に従わせられます。この構成により、権限はコード側に保持され、Jev は固定ルールでは表現しづらい判断だけを担います。
Jev と従来の LLM の比較
Jev と大規模言語モデルは異なる役割を持ちます。
| 次元 | Jev | 従来の LLM |
|---|---|---|
| 主な出力 | 型付きの決定と確率 | 生成されたテキスト、コード、または構造化トークン |
| 回答空間 | 推論前に定義 | 制約しない限りオープンエンド |
| サンプリング | 質問が並列に評価される | トークンが逐次生成される |
| 想定ワークロード | 分類、ルーティング、スコアリング、検証 | 会話、推論、執筆、コーディング |
| 不確実性 | 確率分布;Choice と Score は信頼度を提供 | プロバイダや手法に依存 |
| スキーマ動作 | サポートする質問タイプに従う出力 | 構造化出力にはスキーマ制約付き生成が必要 |
| 最適な役割 | ソフトウェア内の意思決定レイヤー | 計画と生成のレイヤー |
Jev を小さなチャットボットと表現すべきではありません。TypeSafe はパラメータ数やアーキテクチャを分類できるほどの詳細を公開していません。公的な区別は、学習目的、サンプリング方法、インターフェースに基づいています。
また Jev は決定的なコードの代替ではありません。条件が明示的かつ安定している場合、固定ルールが適切です。税額計算、権限リスト、ファイルサイズ制限を確率的なモデル呼び出しに置き換えるべきではありません。Jev は手書きルールが脆弱になりがちだが、望ましい回答を境界付けできる場面に有用です。
Jev と構造化 LLM 出力の比較
構造化出力は、言語モデルに JSON やスキーマ準拠の値を返させます。生成的な推論と機械可読な結果の両方が必要なワークフローに有用です。Jev はより狭い問題を扱います。
LLM ではスキーマが生成応答の形式を制約します。Jev では質問と回答空間そのものがモデルインターフェースです。Jev は、アプリケーションロジックに組み込むことを意図した確率分布を返し、独立した質問を共有状態に対して個別に評価します。
JSON の形が一致しても挙動の一致は保証されません。両システムが department というフィールドを返しても、レイテンシ、キャリブレーション、あいまいさの扱い、応答の安定性は異なるかもしれません。Jev と構造化 LLM 出力を比較するチームは、アプリケーションのスキーマを一定に保ち、同一のラベル付きデータで両システムをテストすべきです。
RLCD と校正された決定
TypeSafe は Jev を RLCD(Reinforcement Learning for Calibrated Decisions)で学習するとしています。RLCD は目的が RLHF や RLVR と異なります。
RLHF は人間の選好シグナルで応答を最適化し、会話アシスタントで広く用いられています。RLVR は検証可能な報酬を用い、正しさをプログラム的に検証できるタスクに関連します。RLCD は、生成テキストではなく、決定と校正された確率を返すようモデルを学習します。
校正(キャリブレーション)は予測群に関する性質です。モデルがよく校正されていれば、0.8 前後の確率を割り当てた事例群は、適切な集合において約 80% の正解率を示すべきです。特定の予測が 0.8 であることが、その個別の正しさを保証するわけではありません。
確率と信頼度は同義ではありません。Choice と Score は完全な確率分布を公開します。TypeSafe は各分布の形状から信頼度を導出します。1 つの選択肢に確率が集中していれば高い信頼度となり、平坦な分布はあいまいさを示します。提供された信頼度を利用しても、確率から別の統計量を計算しても構いません。
Noul には別個の信頼度フィールドはありません。値そのものが評価した陳述が真である確率です。
Jev のモデル仕様と価格
以下は 2026年9月21日に確認した TypeSafe の公式モデルドキュメントからの情報です。
| 項目 | 公式に記載された値 |
|---|---|
| 現行安定モデル | Jev 1.13 |
| バージョン付きモデル ID | jev-1.13.0 |
| 安定エイリアス | jev-latest |
| 入力 | テキスト;文字列、JSON オブジェクト、またはテキスト配列 |
| リクエスト文脈上限 | 状態とすべての質問の合計で 64,000 トークン |
| 追加コンテキスト規則 | 状態 + 最長の質問の合計で 32,000 トークン |
| 入力価格 | 100 万トークンあたり $0.042(10 億トークンで $42) |
| 出力価格 | 無料 |
| 公開レート制限 | 1 秒あたり 250,000 トークン、1 分あたり 1,200 リクエスト |
| 主な学習言語 | 英語 |
| 非テキスト入力 | 直接は未対応 |
TypeSafe はレート制限が動的に調整され、予告なく変更され得るとしています。最新の制限と価格は本番導入前に確認してください。
また、英語が主な学習言語であり、現時点で最も高い精度を提供すると記載されています。他言語(CJK を含む)もサポートされますが同等ではありません。中国語、日本語、韓国語のワークロードは、自動化前に代表データで評価すべきです。
TypeSafe によれば、Jev は各顧客データでのファインチューニングや LoRA 適用は行っていません。同一のモデル重みがすべてのアカウントで用いられます。ドメイン挙動は状態、指示、基準、アプリケーション側の合成で形作られます。また、顧客のリクエストやレスポンスは Jev の学習に使用しないとしています。エンタープライズ顧客は TypeSafe の法務ドキュメントでデータ保持ゼロの条件を確認できます。
Jev はどれほど速いか?
TypeSafe はエンドツーエンドの応答時間が 70 ~ 500 ミリ秒と報告しています。ローンチ投稿では、選定したフロンティアモデル呼び出しの 3 ~ 329 秒と比較し、System One 形のクエリでは同等の知能レベルで 40 ~ 200 倍高速であると述べています。
同社は自社ワークフロー評価で、速度 193.6 倍、コスト 444.6 倍のピーク改善を報告しています。これらの数値には文脈が必要です。
数値は TypeSafe 独自の評価フレームワークから得られています。ワークフローは構造化された意思決定グラフ上でモデルを比較し、選定した高性能外部モデルの平均予測を基準確率として用います。TypeSafe は、報告された改善は現実世界の改善の上限近辺である可能性が高いとし、同社のモデル能力チームのメンバーがワークフローを作成したためバイアスの可能性を認めています。
これらの結果を、Jev があらゆるタスクであらゆる LLM より何百倍も速いという一般的主張として読むべきではありません。Jev はテキスト生成を放棄し、境界付けされた決定を対象にしています。公平な比較では、両システムが実行可能なタスクを用い、意思決定の品質とレイテンシの両方を測定し、検証・再試行・人間レビューのコストを含めるべきです。
Jev が最適な用途
Jev は、回答空間が定義され不確実性の見積もりを必要とする高ボリュームのワークフローに最適です。
- 顧客サポートのトリアージ:部門、緊急度、フラストレーション、離脱リスク、人間レビュー要否でチケットを分類。
- インテントおよびモデルルーティング:リクエスト種類を特定し、適切なツール、ワークフロー、エージェント、モデルへルート。信頼度で自動ルーティングの可否を決定。
- エージェントのツールリスクチェック:実行前に、提案されたツール呼び出しの破壊性、機微データ、ユーザー要求との不整合を評価。権限はアプリケーションコードが保持。
- LLM 出力評価:LLM 応答が提供コンテキストに裏付けられているか、所定形式に従っているか、人間レビューが必要かを確認。
- コンテンツモデレーション:ポリシーカテゴリに Choice、重大度に Score、二値ルールチェックに Noul。低信頼度ケースはモデレーターへ。
- 高ボリュームデータ処理:ログ、メール、レビュー、リード、広告、文書セグメントなど、各レコードを独立評価でき、出力がカテゴリー、スコア、確率である場合。
AI エージェント内での Jev の位置づけ
AI エージェントは一般に、生成モデル、ツール、アプリケーション状態、実行を制御するルールを組み合わせます。Jev は主生成モデルの周囲にある構造化意思決定レイヤーとして組み込まれます。
生成モデルは、リクエスト解釈、ワークフロー計画、コンテンツ執筆、コード生成などオープンエンドなタスクを担当できます。Jev はワークフロー中に繰り返し発生する狭い決定を担当します。
- どのツールやモデルを使うべきか?
- 提案されたアクションはリスキーか、要求と不整合か?
- 継続・再試行・停止・確認依頼のどれを選ぶべきか?
- 結果は定義済み要件を満たしているか?
- タスクを人間にエスカレートすべきか?
アプリケーションは権限、閾値、副作用の責任を保持します。Jev は決定と関連確率を提供し、それに基づく次のアクションをアプリケーションコードが決定します。
この職責分担により、生成モデルはオープンエンドな推論、Jev は境界付けされた評価、決定的コードはポリシーの強制、ツールは外部アクションを担当します。Jev は AI エージェントの主たる推論モデルの代替ではなく補完として機能します。
Jev の制限事項
Jev は文章、コード、オープンエンドな説明を生成しません。定義済みの回答空間を持つ集中した質問向けに設計されています。
型安全な応答でも、誤った決定を含む可能性があります。業務精度は実データで評価する必要があります。入力は現時点でテキストのみがサポートされ、英語が最も強い性能と記載されています。他言語は別途検証が必要です。
Jev の速度とコストの数値は TypeSafe 自身の評価に基づくもので、一般的な性能保証として扱うべきではありません。
Jev と CometAPI
2026年9月21日時点の確認では、Jev は CometAPI の公開カタログで一般利用可能なモデルとして掲載されていません。CometAPI は、アクセスが可能になり必要な接続が開かれ次第、Jev の評価と統合を予定しています。開発者は最新の提供状況を CometAPI モデルディレクトリで確認してください。
Jev は現在、TypeSafe コンソールとその 公式 API から利用可能です。TypeSafe は公式の Python と JavaScript SDK も提供しています。現行 API は state と型付き questions を使用し、安定エイリアスは jev-latest です。
Jev が CometAPI から利用可能になれば、開発者はモデル ID、対応エンドポイント、価格、リクエスト形式を CometAPI API ドキュメント とモデルディレクトリで確認できるようになります。
よくある質問
What is Jev AI?
Jev は TypeSafe のフラグシップモデルで、最初の System One モデルです。テキストベースの状態を型付きの質問に照らして評価し、生成テキストではなく構造化された決定と確率を返します。
Is Jev a large language model?
TypeSafe は Jev を従来の LLM として提示していません。構造化された決定のための System One モデルと呼んでいます。パラメータ数は公開されておらず、公知情報からモデルの大小を分類すべきではありません。
What are Choice, Score, and Noul?
Choice は定義済み集合から選択肢を選び、確率と信頼度を返します。Score は順序づけられたルーブリックで状態を評価し、確率と信頼度を返します。Noul は陳述が真である確率を 0 ~ 1 の値で返します。
Does Jev generate text or code?
いいえ。Jev は制約された決定を返します。ワークフローに文章、対話、ソースコード、オープンエンドな説明が必要な場合は生成モデルが必要です。
Can Jev replace GPT, Claude, or Gemini?
いいえ。Jev は境界付けされた決定タスクを対象とし、汎用 LLM は生成と拡張推論を担当します。本番システムでは、同一ワークフローの異なる段階で両方のモデルタイプを併用できます。
Does Jev support images, audio, or video?
直接は対応していません。現行モデルは文字列、JSON オブジェクト、テキスト配列としての入力を受け付けます。非テキスト入力は先にテキストや構造化フィールドへ変換する必要があります。
Does type-safe output guarantee a correct decision?
いいえ。型安全性は出力がサポート対象の構造に適合することを保証しますが、Jev が誤った有効選択肢を選ぶ、あるいは不正確な確率を割り当てる可能性は残ります。業務精度は代表データで測定する必要があります。
Is Jev open source?
TypeSafe は Jev のモデル重みを公開していません。同社はドキュメント、SDK、サンプル、関連統合コードを公開しますが、それらはモデル自体をオープンウェイトにするものではありません。
結論
Jev は、言語生成ではなく意思決定を中心に据えたモデルインターフェースを導入します。共有の状態と原子的で型付きの質問を受け取り、カテゴリ、スコア、二値確率、そしてソフトウェアが直接利用できる不確実性の尺度を返します。
最も現実的な役割は汎用 LLM の代替ではありません。それらの周囲で頻出する境界付けられた判断を処理することです。カスタマーサポートのルーティング、モデル選択、ツールリスクチェック、出力検証、モデレーション、ワークフロー分類は、回答空間が事前に定義されていれば、このパターンに適合します。
本番での価値は、低レイテンシやスキーマ適合だけでは決まりません。代表評価、校正された閾値、明示的な権限ルール、モデルバージョン管理、人間レビュー経路が必要です。TypeSafe 公表の速度とコストの数値は、意思決定が多いワークロードで Jev を試す動機になりますが、その主張は同社の評価手法に結び付いており、実際のアプリケーションデータで検証すべきです。
すでに CometAPI 経由で複数の生成モデルを使用しているチームにとって、Jev は、生成、確率的判断、決定的ポリシー、ツール実行を別個のコンポーネントに分ける広いアーキテクチャを示します。この分離により各部分はテストしやすくなり、アプリケーションコードが最終的な制御を保持できます。
