AI-translated from English; not yet reviewed by a fluent editor.

# Jev 시연, 일상 소프트웨어에서 AI 판단이 들어가는 지점 보여 줘

> Jev의 8가지 시연은 유형이 지정된 AI 판단이 기존 앱에서 순위를 매기거나 항목을 선택·필터링하는 방식을 보여 준다. 주변 소프트웨어가 여전히 맡는 일과 아직 시험되지 않은 부분을 살펴본다.

By BIG CHANGE Editorial

Published: 2026-09-24T22:47:28.571Z
Updated: 2026-09-24T22:47:28.571Z
Canonical: https://bigchange.ai/blog/jev-demos-ai-decisions-everyday-software

![Charcoal illustration of a desktop monitor showing a generic web article with one passage highlighted in orange.](https://bigchange.ai/api/media/file/jev-find-in-page-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

8가지 사례는 [Matthew Berman의 9월 24일 영상](https://www.youtube.com/watch?v=jGD_UR4wMJc)에서 TypeSafe AI의 Jev 모델을 웹페이지 정리, 문단 찾기, 받은편지함 정렬, 인터페이스 요소 선택 등 익숙한 작업에 적용한다. 시연은 서로 다른 개발자들이 만들었다. 공통된 접근은 모델에 좁은 판단을 맡기고, 애플리케이션이 입력을 모아 결과를 실행하는 것이다.

판단과 코드 또는 다른 모델이 수행하는 작업을 분리해서 보면 각 영상이 더 많은 정보를 준다. 사용자가 알아차릴 수 있는 오류 가능성도 모델 호출만큼 중요하다. 이는 시연과 초기 도구이며 BIG CHANGE가 정확도나 일상적인 신뢰성을 독립적으로 시험하지 않았다.

## 큰 변화

- **달라진 점:** 개발자들이 브라우저 바로 가기부터 받은편지함 화면까지 기존 소프트웨어 상호작용에 유형이 지정된 AI 판단을 끼워 넣고 있다. Jev는 선택, 점수 또는 확률을 반환하고, 애플리케이션은 후보 자료를 제공한 뒤 그 답에 따라 동작한다.
- **중요한 이유:** 채팅 인터페이스에 전체 작업을 맡기지 않고도 사용자가 읽거나 검색하거나 분류하는 순간 유용한 판단을 내릴 수 있다. 같은 설계에서 잘못된 순위, 숨겨진 콘텐츠, 의도하지 않은 작업에 대한 책임은 애플리케이션 운영자에게 남는다.
- **지켜볼 점:** 다음에 필요한 증거는 작업별로 다르다. 이런 도구가 올바른 문단을 찾고, 페이지의 필수 제어 기능을 보존하며, 중요한 이메일을 잘 분류하고, 일상적인 사용에서 불확실한 경우를 제대로 다루는지 확인해야 한다. 빠른 시연만으로는 답을 낼 수 없다.

## 페이지 정리 도구가 보여 주는 역할 분담

[Kitze의 Unclutter 브라우저 확장 프로그램](https://x.com/thekitze/status/2100595129874817340)이 가장 분명한 사례다. 해당 [프로젝트 README](https://github.com/kitze/unclutter)에 따르면 확장 프로그램은 페이지에서 후보 요소를 추출하고 Jev에게 불필요한 요소를 판단하게 한다. 이후 브라우저 코드가 되돌릴 수 있는 숨김 규칙을 적용하고 페이지 템플릿별로 저장해 모델을 다시 요청하지 않고 해당 규칙을 적용한다. 사용자는 확장 기능을 일시 중지하고, 요소를 계속 표시하거나 페이지를 다시 분석할 수 있다. 쿠키 오버레이는 숨길 수 있지만 확장 프로그램이 사용자를 대신해 수락 또는 거절 버튼을 누르지는 않는다.

이는 결과가 달라지는 중요한 경계다. Jev는 어떤 요소가 잡동사니인지 판단할 수 있지만 브라우저를 통제하거나 동의 선택을 대신 작성하거나 규칙의 유지 기간을 결정하지는 않는다. 실제 평가에서는 정리 후에도 내비게이션, 접근성 제어, 유료화 안내 및 실제 동의 선택지가 계속 사용 가능한지 확인해야 한다. 프로젝트는 소스 빌드와 자체 API 키를 가져오는 설정을 제공하지만 README에는 이런 오류에 대한 독립적인 현장 연구가 없다.

Jev로 만든 [웹사이트 탐지기](https://madewithjev.com/free-tools/ai-slop-detector)는 Berman 영상의 [3:29 장면](https://www.youtube.com/watch?v=jGD_UR4wMJc&t=209s)에서 소개되며 다른 처리 과정을 쓴다. 자체 설명에 따르면 브라우저가 렌더링된 스타일을 측정하고, DeepSeek V4 Flash가 스크린샷을 설명하며, Jev가 여러 징후 목록에 따라 디자인과 문구를 판단하고, DeepSeek가 짧은 판정을 작성한다. 사이트는 anthropic.com에 대해 ‘슬롭’ 점수 26%를 표시한다. 이는 해당 도구가 자체 평가 기준에 따라 계산한 문체 점수다. 영상에서 Berman이 추론한 내용과 달리 Anthropic 사이트의 몇 퍼센트가 AI로 작성됐는지를 입증하지 않는다.

## 정보 순위 지정은 별도의 판단 유형이다

[Jonathan Unikowski의 받은편지함 시연](https://x.com/jnnnthnn/status/2101399331115077760)은 최신순 대신 실시간 중요도 순위를 적용하자고 제안한다. 게시물에 따르면 이 기능은 Avec에 ‘출시 예정’이다. 실제 배포된 받은편지함이나 중요도 정의, 긴급 메일을 놓치는 비율에 대한 독립 측정치는 제시하지 않는다. 애플리케이션은 여전히 메일을 가져오고 순서를 보여 주며 보관, 라벨 지정 또는 전송 여부를 결정해야 한다. 시연에서 Jev가 맡는 역할은 우선순위 지정이다.

[Shubham Saboo의 Needle 확장 프로그램](https://x.com/Saboo_Shubham_/status/2101576462042366114)은 차이를 더 명확히 보여 준다. Saboo에 따르면 Jev가 독자의 검색어에 비춰 페이지 문단에 점수를 매기고 확장 프로그램이 일치하는 문장을 원래 위치에서 강조한다. 그의 [상세 설명](https://www.linkedin.com/posts/shubhamsaboo_introducing-a-new-way-to-find-f-withtypesafe-activity-7507513455138979841-CY8S)에 따르면 Needle은 답변을 작성하지 않는다. 강조된 문장은 페이지에 이미 존재한다. 이는 페이지 내 찾기 기능의 검색 방식을 바꾸지만, 강조된 문장도 틀릴 수 있다. 평가하려면 정답 문단을 알고 있는 검색어를 사용해야 하며 비슷하지만 서로 상충하는 진술이 있는 페이지도 포함해야 한다.

[Burhan Usman의 클립 제작 게시물](https://x.com/BurhanUsman/status/2101641842441732297)은 90분이 넘는 영상에서 특정 주제의 클립을 찾았다고 전한다. [영상의 8:34 구간](https://www.youtube.com/watch?v=jGD_UR4wMJc&t=514s)에서 Berman은 시스템이 아마 대본을 사용한다고 말한다. 이는 확인된 파이프라인 설명이 아니라 그의 추론이다. 게시물은 Jev가 정확히 어떤 입력을 받고 무엇을 출력하는지 밝히지 않는다. 클립 제작 애플리케이션은 여전히 원본 자료를 확보하고 시간 경계를 정하며 다운로드할 수 있는 클립을 만들어야 한다. 소요 시간과 비용은 한 개발자의 보고이며 정확도 시험이나 전체 처리 과정의 세부 내역은 공개되지 않았다.

## UI 구성을 애플리케이션에 남기는 방식

[Chris Tate의 json-render 실험](https://x.com/ctatedev/status/2101022101750571357)은 애플리케이션이 소유한 선택지로 사용자 인터페이스를 구성한다. [Jev 프로젝트 문서](https://github.com/vercel-labs/json-render/blob/main/apps/web/lib/jev/README.md)는 역할을 특히 명확히 설명한다. Jev는 컴포넌트와 배치 위치를 선택하고, 코드는 명세를 조립하고 검증하며, 렌더러가 이를 표시한다. 플레이그라운드의 업무 데이터는 합성 데이터이며 동작 처리기는 사용자가 상호작용할 때 실행된다. 따라서 이 시연은 범위가 정해진 인터페이스를 구성하는 방법을 보여 주는 것이지, 모델이 독립적으로 웹사이트를 작성하고 배포하는 사례가 아니다.

두 가지 창작 사례는 위험도가 낮은 선택을 탐색한다. [Matt DesLauriers의 색상 실험](https://x.com/mattdesl/status/2100899669802963060)은 시각적 시연에서 텍스트 프롬프트를 색상 팔레트로 연결한다. [Stefan의 이모지 실험](https://x.com/heystefan_/status/2101369117496521042), Berman 영상의 [9:52 구간](https://www.youtube.com/watch?v=jGD_UR4wMJc&t=592s)에서는 입력한 텍스트에 어울리는 이모지 순위를 매긴다. 두 사례 모두 앱이 선택 가능한 시각 요소를 보여 준다. 게시물은 상호작용 아이디어를 시연할 뿐 브랜드 적합성, 명암 대비 요건 또는 여러 언어와 맥락에서의 작동을 입증하지 않는다.

TypeSafe의 [문서](https://docs.typesafe.ai/introduction)는 이 사례들이 서로 닮은 이유를 설명한다. Jev는 제공된 상태를 바탕으로 유형이 지정된 Choice, Score 및 예·아니요 질문을 평가한다. Choice와 Score는 소프트웨어가 자체 규칙에 사용할 수 있는 확률 분포와 신뢰도 값을 반환한다. 회사는 [실제 작업에서 임곗값을 시험할 것을 권한다](https://docs.typesafe.ai/confidence). 신뢰도 필드는 독립적인 정확도 측정 결과가 아니다.

이 사례들은 신뢰할 만한 설계 유형을 보여 준다. 고정 규칙이 지나치게 경직될 때 소프트웨어는 시의적절하고 범위가 좁은 질문을 할 수 있다. 특정 도구가 일상 업무에 적합한지는 어떤 오류를 내는지, 무엇을 드러내거나 숨기는지, 사용자가 복구할 방법이 있는지에 달려 있다. 이런 특성은 모델의 판단만이 아니라 전체 작업 흐름의 속성이다.

## Sources

- [Matthew Berman: 속임수처럼 느껴질 정도인 Jev 활용 사례 8가지](https://www.youtube.com/watch?v=jGD_UR4wMJc) — 10분 38초 분량의 영상은 여러 개발자의 시연 여덟 가지를 모았다. 전체 영어 자동 자막과 챕터 목록을 검토했다. 5:17~6:31 구간의 Zapier 내용은 협찬이다. 이 영상은 독립적인 제품 검증 자료가 아니다.
- [TypeSafe AI: System One 모델 및 Jev 소개](https://typesafe.ai/blog/introducing-system-one-models-and-jev) — 구조화된 모델 판단에 대한 공식 초기 접근 발표 및 설명 자료다. 성능 수치는 회사가 명시된 제한 아래 수행한 시험 결과이며, 이 기사에서는 여덟 시연의 벤치마크로 사용하지 않았다.
- [TypeSafe AI: Introduction 및 Confidence 문서](https://docs.typesafe.ai/introduction) — Jev가 받는 상태 정보와 Choice, Score 및 Noul 질문 유형을 문서화한다. 함께 제공되는 Confidence 페이지는 Choice와 Score 신뢰도가 답변 분포에서 도출되며 작업별 행동 임곗값은 직접 시험해야 한다고 설명한다.
- [TypeSafe AI: Confidence](https://docs.typesafe.ai/confidence) — 답변 확률, 도출된 신뢰도, 작업별 운영 임곗값의 차이를 설명한다. 이 기사의 개별 시연 정확도를 입증하지 않는다.
- [Made with Jev: AI Slop Detector](https://madewithjev.com/free-tools/ai-slop-detector) — 제작자는 브라우저 측정, DeepSeek의 스크린샷 관찰, Jev의 판단, 별도의 DeepSeek 판정을 설명한다. anthropic.com에 대한 26% 예시는 사이트 자체의 문체 평가 기준에 따른 점수이지 AI 작성 여부의 증거가 아니다.
- [Kitze: Unclutter 소개 및 소스 코드](https://github.com/kitze/unclutter) — 개발자의 원본 README는 Jev를 이용한 후보 분류, 되돌릴 수 있는 로컬 숨김 규칙, 템플릿 재사용 및 사용자 제어 기능을 설명한다. 9월 17일 게시물 원문은 https://x.com/thekitze/status/2100595129874817340. 독립적인 실제 환경 평가는 찾지 못했다.
- [Jonathan Unikowski: Jev 받은편지함 우선순위 지정](https://x.com/jnnnthnn/status/2101399331115077760) — 개발자는 실시간 중요도 순위를 시연하며 해당 기능이 Avec에 출시 예정이라고 밝혔다. 이는 시연과 제안된 출시를 입증하지만 배포된 받은편지함이나 측정된 우선순위 정확도를 보여 주지는 않는다.
- [Shubham Saboo: Needle 의미 기반 페이지 찾기](https://x.com/Saboo_Shubham_/status/2101576462042366114) — 개발자가 오픈소스 Chrome 확장 프로그램을 소개한다. 그의 상세 LinkedIn 설명에 따르면 Jev는 기존 페이지 문단에 점수를 매기고 확장 프로그램은 대체 답변을 생성하지 않고 해당 문단을 강조한다. 독립적인 검색 평가 결과는 제시되지 않는다.
- [Chris Tate: json-render 및 Jev 실험](https://github.com/vercel-labs/json-render/blob/main/apps/web/lib/jev/README.md) — 프로젝트 문서에 따르면 Jev는 앱이 소유한 UI 후보 중에서 선택하고, 코드는 명세를 조립하고 검증하며, 렌더러가 이를 표시한다. 원본 9월 18일 시연 게시물은 https://x.com/ctatedev/status/2101022101750571357. 플레이그라운드의 데이터는 합성 데이터다.
- [Burhan Usman: 주제별 영상 클립 시연](https://x.com/BurhanUsman/status/2101641842441732297) — 개발자는 90분이 넘는 영상에서 주제별 클립을 만들었다고 보고한다. 게시물에는 전체 파이프라인, 검증된 시간 경계 또는 클립 정확도가 공개되지 않았다. Berman의 대본 사용 설명은 그의 영상에서 나온 추론이다.
- [Matt DesLauriers: Jev 색상 실험](https://x.com/mattdesl/status/2100899669802963060) — 원본 시각 실험은 텍스트와 색상 팔레트를 연결한다. 제작 시 디자인 적합성이나 접근성 규정 준수를 입증하는 자료는 아니다.
- [Stefan: Jev 이모지 실험](https://x.com/heystefan_/status/2101369117496521042) — 원본 게시물과 Berman 영상의 9:52 구간은 입력 텍스트에 맞춰 이모지를 선택하는 시연을 보여 준다. 사용성이나 여러 언어에 대한 평가는 제시되지 않았다.
