公開:2026年9月21日, 最終更新:2026年9月21日
30秒サマリー
- TypeSafe AIがJevをリリース。テキストではなく型付きの決定と確率値を返すトランスフォーマー系モデル。
- Choice・Score・Noulの3種の質問型を1リクエストで並列処理し、信頼スコアで人間レビューの要否を判定可能。
- 自社計測では既存LLM比で最大193.6倍高速・444.6倍低コストと主張するが、ベンチマークはベンダー自身が実施。
何が起きたか
TypeSafe AIは2026年9月19日、「Jev」と呼ぶAIモデルをウェイトリスト付きのホスト型APIとして早期アクセス提供開始した。Jevはトランスフォーマーをベースとするが、大規模言語モデル(LLM)ではなく、テキストを生成しない。開発者は「状態(state)」と型付きの質問を送信すると、コードが分岐処理に利用できる確率付きの型付き決定が返ってくる仕組みだ。アーキテクチャの詳細や重みは非公開で、セルフホスト方式も現時点では提供されていない。
APIの質問型は3種類。複数の選択肢から1つを選ぶ「Choice」、順序付きレベルで評価する「Score」、文の真偽を0〜1の確率で返す「Noul」。これらは同一のstateに対して並列・独立して実行される。ChoiceとScoreの回答には0〜1の信頼値(confidence)が付与され、確率分布の形状から算出される。TypeSafeはこの信頼値に基づき「高信頼なら自動処理、中程度なら人間レビュー、低信頼なら人間に転送」という3段階の運用を提案している。
価格は入力100万トークンあたり0.042ドル(42ドル/10億トークン)で、出力トークンは無料と記載されている。TypeSafeが自社ワークフロー評価で計測したデモ結果では、Jevが0.114秒・0.000081ドルで処理した同等タスクをGPT-5.6 Terraが8.566秒・0.013880ドルで処理したとし、193.6倍高速・444.6倍低コストと主張している。ただしこのベンチマークはTypeSafe自身が設計・実施したものであり、参照回答もGPT-6 AstraとFable 5.1の平均値を用いている。またTypeSafeは「価格が補助されていないことを証明できない」とも明言しており、独立した検証ではない点に留意が必要だ。
リリース直後からコミュニティでの活用事例が報告されており、メールのトリアージ、ブラウザエージェント、スマートフォン操作エージェント、StarCraftのゲームプレイ、エージェントのガードレール実装など多様な用途が確認されている。Vercel CEOのGuillermo Rauch氏は、コマンド安全審査の用途でGPT Lunaと比べp95でJevが最大18倍高速だったと報告したとされる(レビュー処理自体はLunaを継続使用)。
原典ハイライト
原文は「『ゼロ幻覚』はスキーマ整合性が保証されるという意味であり、0%という数値は実証的なものではなく、回答が誤っている可能性はある」と明示している。またベンチマークはTypeSafeのケイパビリティチームが作成したワークフローに基づくものであり、TypeSafeは「この数値は実際のユースケースでの上限値に当たると想定している」と述べている。
So What?(なぜ重要か)
JevはLLMのようにテキストを生成するのではなく、コードが直接利用できる型付きの決定と確率値を返す点が構造的に異なる。信頼スコアを活用した「人間の介在要否」の自動判定ロジックを組み込みやすい設計であり、エージェントAIにおける意思決定層を既存LLMから置き換える可能性を示している。ただしアーキテクチャ・重み・価格の持続性が非公開であり、ベンチマークもベンダー主導のため、独立した性能検証が現時点では行えない。
日本企業への示唆
AIエージェントや自動化ワークフローを構築・検討中の日本企業にとっては、LLM以外の選択肢として注目に値する。特に分類・判定・優先順位付けといった構造化された意思決定タスクで、レイテンシとコストの削減が見込める可能性がある。一方で、ウェイトリスト制の早期アクセスであり、アーキテクチャや価格設定の透明性が低い現段階では、本番導入前に自社データでの検証が不可欠。「ゼロ幻覚」の主張はスキーマ形式上の保証に限られ、回答の正確性を保証するものではない点を明確に認識した上で評価すべきだ。
背景・経緯
TypeSafe AIは、2022年のChatGPT登場を「AIが人と話せるようになった瞬間」と位置付け、次の転換点を「AIがソフトウェアと話す」段階とする世界観のもとJevを開発したと説明している。「System One Model」という名称はダニエル・カーネマンの「速い直感」と「遅い推論」の区分から借用。RLHFが人間の好みに合わせてモデルを調整した結果、チャット特化・過信・モード脱落といった課題が生じ、人間の監視が必要になったという問題意識が開発の出発点とされている。







