Jev는 생성된 산문이 아닌 구조화된 결정을 필요로 하는 애플리케이션을 위해 설계된 TypeSafe AI의 첫 번째 System One 모델입니다. Jev는 제공된 정보를 명확히 정의된 질문에 비춰 평가하고, 타입이 지정된 답변, 확률 분포, 그리고 적용 가능한 경우 신뢰도 점수를 반환합니다.
일반적인 대형 언어 모델과 달리 Jev는 채팅, 코드 작성, 장문의 콘텐츠 생성을 목적으로 하지 않습니다. Jev의 목적은 소프트웨어가 분류, 라우팅, 점수화, 검증, 우선순위 지정, 워크플로 제어에 즉시 사용할 수 있는 한정된 판단을 내리는 것입니다.
모델 정보는 2026년 9월 21일에 검토되었습니다.
Jev 기술 사양
| 사양 | 세부 정보 |
|---|---|
| 개발사 | TypeSafe AI |
| 모델 계열 | System One |
| 현재 안정화 버전 | Jev 1.13 |
| 버전형 모델 ID | jev-1.13.0 |
| 안정적 별칭 | jev-latest |
| 입력 | 텍스트, JSON 객체, 또는 텍스트 값 배열 |
| 출력 | 타입 지정된 결정과 확률 분포 |
| 질문 유형 | Choice, Score, Noul |
| 컨텍스트 한도 | 요청당 64,000 토큰 |
| 추가 컨텍스트 제약 | 상태와 가장 긴 질문을 합쳐 32,000 토큰 |
| 공개 입력 가격 | 백만 토큰당 $0.042 |
| 공개 출력 가격 | 무료 |
| 공개 레이트 제한 | 초당 250,000 토큰, 분당 1,200 요청 |
| 주 언어 | 영어 |
| 직접 멀티모달 입력 | 지원되지 않음 |
가격, 별칭, 레이트 제한은 변경될 수 있습니다. 개발자는 워크로드를 프로덕션에 도입하기 전에 최신 정보를 확인해야 합니다.
Jev란 무엇인가?
Jev는 TypeSafe AI가 개발한 결정 모델입니다. 개방형 토큰 시퀀스를 생성하는 대신, 개발자가 정의한 답변 공간에서 값을 선택합니다.
Jev 요청은 두 가지 핵심 구성요소로 이루어집니다:
- State: 지원 티켓, 거래 기록, 에이전트 트레이스, 제품 설명, 또는 JSON 형식의 애플리케이션 상태 등 모델이 평가해야 하는 정보
- Questions: 그 상태에 대해 내려야 할 판단을 타입으로 정의한 항목
결과로 생성되는 답변은 소프트웨어에서 직접 사용하도록 설계되었습니다. 애플리케이션은 선택된 범주로 분기하거나, 점수를 비교하거나, 확률을 확인하거나, 신뢰도 임계값을 적용하거나, 불확실한 사례를 인간 검토자로 전달할 수 있습니다.
Jev는 따라서 애플리케이션 데이터와 결정적 비즈니스 로직 사이의 확률적 결정 레이어로 작동합니다. 고정 규칙으로 표현하기 어려운 판단을 처리하면서도, 애플리케이션 코드가 임계값, 권한, 동작을 계속 제어할 수 있게 합니다.
Jev는 어떻게 작동하는가
세 가지 결정 프리미티브
Jev는 다양한 소프트웨어 결정을 위해 설계된 세 가지 질문 유형을 지원합니다.
Choice는 사전에 정의된 집합에서 하나의 옵션을 선택합니다. 의도 분류, 티켓 라우팅, 정책 범주화, 모델 선택 같은 작업에 적합합니다. 응답에는 선택된 옵션, 각 옵션에 할당된 확률, 신뢰도 점수가 포함됩니다.
Score는 순서가 있는 루브릭을 기준으로 상태를 평가합니다. 긴급성, 위험, 관련성, 좌절감, 콘텐츠 품질 같은 속성을 측정할 수 있습니다. 응답에는 점수, 루브릭 각 단계에 대한 확률, 신뢰도 점수가 포함됩니다.
Noul은 진술이 참일 확률을 추정합니다. 0과 1 사이의 값을 반환하며, 검증, 정책 점검, 적격성 결정, 완료 게이트 등에 유용합니다. Choice와 Score와 달리, Noul은 출력 자체가 확률이므로 별도의 신뢰도 필드를 반환하지 않습니다.
질문 병렬 평가
단일 요청에 Choice, Score, Noul 질문을 여러 개 포함할 수 있습니다. Jev는 동일한 상태에 대해 이들 질문을 서로 독립적으로 병렬 평가합니다.
예를 들어, 지원 플랫폼은 하나의 요청에서 티켓을 분류하고, 긴급성을 평가하며, 인간 에스컬레이션 필요성을 추정할 수 있습니다. TypeSafe는 독립적인 질문을 추가해도 응답 시간에 미치는 영향이 적다고 밝힙니다.
같은 요청 내의 질문들은 서로의 답변에 의존할 수 없습니다. 연쇄적인 결정은 애플리케이션 로직으로 연결된 별도의 호출로 구현해야 합니다.
타입 안전 응답
Jev의 가능한 응답 구조는 추론 전에 정의됩니다. 이는 범주나 수치 값이 필요한 위치에 잘못된 JSON, 예기치 않은 필드, 설명 텍스트가 나타나는 것을 방지합니다.
타입 안전성은 응답 형식만 보장합니다. Jev가 형식상 유효하지만 잘못된 결정을 반환할 수 있으므로, 프로덕션 팀은 대표 데이터로 정확도를 평가해야 합니다.
명시적 확률과 신뢰도
Choice와 Score는 각 답변 뒤에 있는 확률 분포를 노출합니다. 신뢰도 값은 그 분포가 단일 결과를 얼마나 강하게 지지하는지 요약합니다.
애플리케이션은 신뢰도를 사용하여 명확한 결정을 자동화하고, 불확실성이 중간일 때 확인을 요청하며, 애매한 사례를 인간 또는 폴백 모델로 라우팅할 수 있습니다.
적절한 임계값은 위험에 따라 달라집니다. 지원 티켓 태깅은 거래 승인이나 되돌릴 수 없는 행위 실행보다 더 많은 불확실성을 허용할 수 있습니다.
저지연 추론
TypeSafe는 종단 간 응답 시간이 약 70~500밀리초라고 보고합니다. 이는 Jev를 인터랙티브 라우팅, 반복적인 에이전트 점검, 느린 생성형 모델 호출이 반응성에 영향을 줄 수 있는 기타 결정 중심 워크플로에 적합하게 만듭니다.
실제 지연 시간은 상태 크기, 서비스 부하, 네트워크 조건, 배포 지역에 따라 달라집니다.
요청 수준 맞춤화
Jev는 계정별 파인튜닝이나 LoRA 어댑터로 커스터마이즈되지 않습니다. 개발자는 관련 상태를 제공하고, 정밀한 지침을 작성하고, 명확한 기준을 정의하며, 원자적 결정을 애플리케이션 코드에서 조합하여 적응시킵니다.
이 접근 방식은 비즈니스 규칙을 가시적으로 유지하고, 팀이 모델을 재학습하지 않고도 워크플로 로직을 변경할 수 있게 합니다.
버전 지정 모델과 안정적 별칭
TypeSafe는 고정 모델 ID와 이동 별칭을 제공합니다. jev-1.13.0은 특정 릴리스를 식별하고, jev-latest는 최신 안정 버전을 가리킵니다. jev-preview는 사용 가능한 경우 더 최신의 프리뷰 릴리스로 이동할 수 있습니다.
별칭은 실험을 단순화하지만, 업데이트 후 동작이 변경될 수 있습니다. 보정된 임계값으로 운영되는 프로덕션 애플리케이션은 테스트된 버전에 고정하고, 각 응답과 함께 반환되는 모델 ID를 기록해야 합니다.
Jev의 벤치마크 성능
Jev는 작성, 코딩, 수학적 유도, 장기 추론에 초점을 맞춘 범용 벤치마크를 위해 설계되지 않았습니다. 더 관련 있는 측정치는 결정 품질, 확률 보정, 지연 시간, 비용, 출력 신뢰성입니다.
TypeSafe 보고에 따르면:
- 종단 간 응답 시간 70~500밀리초
- 비교 가능한 System One 작업에서 약 40~200배 빠른 실행
- 워크플로 최고 결과 193.6배 속도 향상
- 최고 보고 비용 개선 444.6배
이는 벤더가 보고한 결과이며 보편적 성능 보장으로 간주되어서는 안 됩니다. TypeSafe의 워크플로 평가에서는 구조화된 결정 그래프에서 모델을 비교하고, 선택된 고급 외부 모델의 평균 예측을 기준 확률로 사용합니다.
또한 TypeSafe는 모델 역량 팀 구성원이 평가된 워크플로를 만들었다고 인정하며, 이는 편향을 유발할 수 있습니다. 보고된 이득은 애플리케이션이 관찰할 수 있는 범위의 상한에 가까울 가능성이 큽니다.
Jev vs 구조화 출력 LLM vs 전통적 분류기 vs 규칙 엔진
| 차원 | Jev | 구조화 출력 LLM | 전통적 분류기 | 규칙 엔진 |
|---|---|---|---|---|
| 주요 기능 | 경계가 정의된 확률적 결정 | 구조화된 응답을 동반한 생성 | 학습된 작업에 대한 예측 | 결정적 로직 |
| 답변 공간 | 요청마다 정의 | 스키마로 제약 | 학습 시 고정 | 코드에 고정 |
| 불확실성 | 내장 확률 및 신뢰도 | 모델과 방법에 따라 다름 | 종종 제공되나 보정이 필요할 수 있음 | 기본적으로 확률적이지 않음 |
| 출력 구조 | 지원되는 프리미티브에 대해 보장 | 대개 제약 생성과 검증 필요 | 구현에 의해 고정 | 구현에 의해 고정 |
| 신규 작업 설정 | 상태, 질문, 기준 정의 | 프롬프트와 스키마 작성 | 라벨링 데이터 수집 및 모델 학습 | 명시적 조건 작성 |
| 오픈엔디드 생성 | 아니오 | 예 | 아니오 | 아니오 |
| 확장 추론 | 목표 워크로드가 아님 | 능력 있는 모델에서 지원 | 아니오 | 인코딩된 로직에 제한 |
| 적응 | 요청 수준 지침과 기준 | 프롬프트와 컨텍스트 변경 | 재학습 또는 특성 엔지니어링 | 코드 변경 |
| 최적 적용 분야 | 소프트웨어 내부의 대규모 판단 | 추론과 생성을 결합한 작업 | 안정적이고 범위가 좁으며 데이터가 풍부한 예측 | 명시적이고 안정적인 조건 |
Jev는 고정 규칙이 지나치게 경직되어 있고, 전용 분류기를 만드는 비용이 크며, 애플리케이션이 생성된 텍스트를 필요로 하지 않을 때 가장 유용합니다.
연구, 설명, 콘텐츠 생성, 기획, 다단계 추론이 필요한 작업에는 전통적 LLM이 더 적합합니다. 올바른 조건이 이미 명시적이고 결정적일 때는 규칙 엔진이 여전히 선호됩니다.
권장 사용 사례
Jev는 미리 정의된 답변 공간을 갖는 빈번한 결정에 가장 적합합니다.
- 라우팅 및 트리아지: 요청 분류, 대기열 또는 도구 선택, 긴급 케이스 우선순위 지정
- 에이전트 제어: 작업 완료 점검, 제안된 행동 평가, 확인이 필요한 사례 식별
- LLM 평가: 관련성, 증거 지원, 정책 준수, 응답 품질 평가
- 모더레이션: 정책 위반 범주화, 심각도 점수화, 불확실 케이스 에스컬레이션
- 데이터 보강: 메시지, 리뷰, 리드, 레코드를 범주, 점수, 확률 특성으로 변환
- 실시간 결정: 전체 생성형 응답이 불필요한 저지연 애플리케이션 동작 지원
Jev의 한계
Jev는 의도적으로 특화되어 있으며, 이처럼 좁은 설계는 몇 가지 중요한 한계를 만듭니다.
- 산문, 코드, 요약, 대화형 응답을 생성할 수 없습니다.
- 장기 연구 또는 다단계 추론을 대상으로 하지 않습니다.
- 타입 안전 출력은 올바른 비즈니스 결정을 보장하지 않습니다.
- 이미지, 오디오, 비디오, 바이너리 파일은 제출 전 텍스트나 구조화 데이터로 변환해야 합니다.
- 영어가 가장 강하게 문서화된 언어입니다.
- 비영어 및 CJK 워크로드는 독립적인 평가가 필요합니다.
- 하나의 요청 내 질문은 서로 독립적으로 평가됩니다.
- 모델은 그 질문들 사이에서 순차적 추론 체인을 구성할 수 없습니다.
- TypeSafe는 모델 파라미터 수를 공개하지 않았고 가중치를 배포하지 않았습니다.
- 커스터마이즈는 고객별 파인튜닝이 아니라 요청을 통해 수행됩니다.
- 공개된 성능 향상은 TypeSafe 자체 평가 프레임워크에서 나온 것입니다.
- 이동 별칭은 애플리케이션 코드 변경 없이도 동작 변화를 가져올 수 있습니다.
Jev는 권한, 금융 계산, 법적 요구사항, 파일 크기 제한, 되돌릴 수 없는 정책 같은 결정적 코드를 대체해서는 안 됩니다. 확률적 모델은 소프트웨어가 이미 정확히 평가할 수 있는 조건이 아니라, 불확실한 판단에 유용합니다.
CometAPI는 Jev API에 대한 접근을 어떻게 제공하나요?
Jev는 현재 CometAPI의 공개 모델 카탈로그에 포함되어 있지 않습니다. CometAPI는 모델 접근이 가능해지고 필요한 연결 권한이 열리면 Jev를 평가하여 통합할 계획입니다.
통합 이후, 개발자는 CometAPI 모델 디렉터리와 API 문서에서 지원되는 모델 ID, 요청 형식, 가격, 레이트 제한, 엔드포인트 가용성을 확인할 수 있습니다.
공식 통합이 발표되기 전까지는 Jev에 접근하기 위해 TypeSafe의 콘솔, 네이티브 API, 공식 SDK를 사용해야 합니다. Jev가 검증된 API 정보와 함께 공개 모델 카탈로그에 나타난 이후에야 CometAPI 통합을 사용할 수 있는 것으로 간주해야 합니다.