8가지 사례는 Matthew Berman의 9월 24일 영상에서 TypeSafe AI의 Jev 모델을 웹페이지 정리, 문단 찾기, 받은편지함 정렬, 인터페이스 요소 선택 등 익숙한 작업에 적용한다. 시연은 서로 다른 개발자들이 만들었다. 공통된 접근은 모델에 좁은 판단을 맡기고, 애플리케이션이 입력을 모아 결과를 실행하는 것이다.

판단과 코드 또는 다른 모델이 수행하는 작업을 분리해서 보면 각 영상이 더 많은 정보를 준다. 사용자가 알아차릴 수 있는 오류 가능성도 모델 호출만큼 중요하다. 이는 시연과 초기 도구이며 BIG CHANGE가 정확도나 일상적인 신뢰성을 독립적으로 시험하지 않았다.

큰 변화

  • 달라진 점: 개발자들이 브라우저 바로 가기부터 받은편지함 화면까지 기존 소프트웨어 상호작용에 유형이 지정된 AI 판단을 끼워 넣고 있다. Jev는 선택, 점수 또는 확률을 반환하고, 애플리케이션은 후보 자료를 제공한 뒤 그 답에 따라 동작한다.
  • 중요한 이유: 채팅 인터페이스에 전체 작업을 맡기지 않고도 사용자가 읽거나 검색하거나 분류하는 순간 유용한 판단을 내릴 수 있다. 같은 설계에서 잘못된 순위, 숨겨진 콘텐츠, 의도하지 않은 작업에 대한 책임은 애플리케이션 운영자에게 남는다.
  • 지켜볼 점: 다음에 필요한 증거는 작업별로 다르다. 이런 도구가 올바른 문단을 찾고, 페이지의 필수 제어 기능을 보존하며, 중요한 이메일을 잘 분류하고, 일상적인 사용에서 불확실한 경우를 제대로 다루는지 확인해야 한다. 빠른 시연만으로는 답을 낼 수 없다.

페이지 정리 도구가 보여 주는 역할 분담

Kitze의 Unclutter 브라우저 확장 프로그램이 가장 분명한 사례다. 해당 프로젝트 README에 따르면 확장 프로그램은 페이지에서 후보 요소를 추출하고 Jev에게 불필요한 요소를 판단하게 한다. 이후 브라우저 코드가 되돌릴 수 있는 숨김 규칙을 적용하고 페이지 템플릿별로 저장해 모델을 다시 요청하지 않고 해당 규칙을 적용한다. 사용자는 확장 기능을 일시 중지하고, 요소를 계속 표시하거나 페이지를 다시 분석할 수 있다. 쿠키 오버레이는 숨길 수 있지만 확장 프로그램이 사용자를 대신해 수락 또는 거절 버튼을 누르지는 않는다.

이는 결과가 달라지는 중요한 경계다. Jev는 어떤 요소가 잡동사니인지 판단할 수 있지만 브라우저를 통제하거나 동의 선택을 대신 작성하거나 규칙의 유지 기간을 결정하지는 않는다. 실제 평가에서는 정리 후에도 내비게이션, 접근성 제어, 유료화 안내 및 실제 동의 선택지가 계속 사용 가능한지 확인해야 한다. 프로젝트는 소스 빌드와 자체 API 키를 가져오는 설정을 제공하지만 README에는 이런 오류에 대한 독립적인 현장 연구가 없다.

Jev로 만든 웹사이트 탐지기는 Berman 영상의 3:29 장면에서 소개되며 다른 처리 과정을 쓴다. 자체 설명에 따르면 브라우저가 렌더링된 스타일을 측정하고, DeepSeek V4 Flash가 스크린샷을 설명하며, Jev가 여러 징후 목록에 따라 디자인과 문구를 판단하고, DeepSeek가 짧은 판정을 작성한다. 사이트는 anthropic.com에 대해 ‘슬롭’ 점수 26%를 표시한다. 이는 해당 도구가 자체 평가 기준에 따라 계산한 문체 점수다. 영상에서 Berman이 추론한 내용과 달리 Anthropic 사이트의 몇 퍼센트가 AI로 작성됐는지를 입증하지 않는다.

정보 순위 지정은 별도의 판단 유형이다

Jonathan Unikowski의 받은편지함 시연은 최신순 대신 실시간 중요도 순위를 적용하자고 제안한다. 게시물에 따르면 이 기능은 Avec에 ‘출시 예정’이다. 실제 배포된 받은편지함이나 중요도 정의, 긴급 메일을 놓치는 비율에 대한 독립 측정치는 제시하지 않는다. 애플리케이션은 여전히 메일을 가져오고 순서를 보여 주며 보관, 라벨 지정 또는 전송 여부를 결정해야 한다. 시연에서 Jev가 맡는 역할은 우선순위 지정이다.

Shubham Saboo의 Needle 확장 프로그램은 차이를 더 명확히 보여 준다. Saboo에 따르면 Jev가 독자의 검색어에 비춰 페이지 문단에 점수를 매기고 확장 프로그램이 일치하는 문장을 원래 위치에서 강조한다. 그의 상세 설명에 따르면 Needle은 답변을 작성하지 않는다. 강조된 문장은 페이지에 이미 존재한다. 이는 페이지 내 찾기 기능의 검색 방식을 바꾸지만, 강조된 문장도 틀릴 수 있다. 평가하려면 정답 문단을 알고 있는 검색어를 사용해야 하며 비슷하지만 서로 상충하는 진술이 있는 페이지도 포함해야 한다.

Burhan Usman의 클립 제작 게시물은 90분이 넘는 영상에서 특정 주제의 클립을 찾았다고 전한다. 영상의 8:34 구간에서 Berman은 시스템이 아마 대본을 사용한다고 말한다. 이는 확인된 파이프라인 설명이 아니라 그의 추론이다. 게시물은 Jev가 정확히 어떤 입력을 받고 무엇을 출력하는지 밝히지 않는다. 클립 제작 애플리케이션은 여전히 원본 자료를 확보하고 시간 경계를 정하며 다운로드할 수 있는 클립을 만들어야 한다. 소요 시간과 비용은 한 개발자의 보고이며 정확도 시험이나 전체 처리 과정의 세부 내역은 공개되지 않았다.

UI 구성을 애플리케이션에 남기는 방식

Chris Tate의 json-render 실험은 애플리케이션이 소유한 선택지로 사용자 인터페이스를 구성한다. Jev 프로젝트 문서는 역할을 특히 명확히 설명한다. Jev는 컴포넌트와 배치 위치를 선택하고, 코드는 명세를 조립하고 검증하며, 렌더러가 이를 표시한다. 플레이그라운드의 업무 데이터는 합성 데이터이며 동작 처리기는 사용자가 상호작용할 때 실행된다. 따라서 이 시연은 범위가 정해진 인터페이스를 구성하는 방법을 보여 주는 것이지, 모델이 독립적으로 웹사이트를 작성하고 배포하는 사례가 아니다.

두 가지 창작 사례는 위험도가 낮은 선택을 탐색한다. Matt DesLauriers의 색상 실험은 시각적 시연에서 텍스트 프롬프트를 색상 팔레트로 연결한다. Stefan의 이모지 실험, Berman 영상의 9:52 구간에서는 입력한 텍스트에 어울리는 이모지 순위를 매긴다. 두 사례 모두 앱이 선택 가능한 시각 요소를 보여 준다. 게시물은 상호작용 아이디어를 시연할 뿐 브랜드 적합성, 명암 대비 요건 또는 여러 언어와 맥락에서의 작동을 입증하지 않는다.

TypeSafe의 문서는 이 사례들이 서로 닮은 이유를 설명한다. Jev는 제공된 상태를 바탕으로 유형이 지정된 Choice, Score 및 예·아니요 질문을 평가한다. Choice와 Score는 소프트웨어가 자체 규칙에 사용할 수 있는 확률 분포와 신뢰도 값을 반환한다. 회사는 실제 작업에서 임곗값을 시험할 것을 권한다. 신뢰도 필드는 독립적인 정확도 측정 결과가 아니다.

이 사례들은 신뢰할 만한 설계 유형을 보여 준다. 고정 규칙이 지나치게 경직될 때 소프트웨어는 시의적절하고 범위가 좁은 질문을 할 수 있다. 특정 도구가 일상 업무에 적합한지는 어떤 오류를 내는지, 무엇을 드러내거나 숨기는지, 사용자가 복구할 방법이 있는지에 달려 있다. 이런 특성은 모델의 판단만이 아니라 전체 작업 흐름의 속성이다.