8つの例をMatthew Bermanが9月24日に公開した動画で見ると、TypeSafe AIのJevモデルがウェブページの整理、文章の検索、受信箱の並べ替え、インターフェース部品の選択など、身近な作業に使われている。デモを作った開発者はそれぞれ異なるが、共通するのは、モデルに限定的な判断をさせ、入力の収集と判断結果に基づく処理はアプリが担う設計だ。

各動画は、判断そのものと、コードや別のモデルが行う処理とを切り分けると、より多くのことを示してくれる。ユーザーが気づく可能性のある誤りも、モデルを呼び出す処理と同じくらい重要だ。これらはデモや初期段階のツールであり、BIG CHANGEは精度や日常利用での信頼性を独自に検証していない。

大きな変化

  • 何が変わったか:開発者は、ブラウザーのショートカットから受信箱の表示まで、既存ソフトウェアの操作に型付きAI判断を組み込んでいる。Jevが選択肢、スコア、確率を返し、候補データの準備と結果に応じた処理はアプリが担う。
  • なぜ重要か:チャット画面に作業全体を任せることなく、読書、検索、仕分けの場面で必要な判断を行える。同じ設計は、誤った順位付け、隠されたコンテンツ、意図しない操作について、アプリ開発者に責任を持たせる。
  • 今後の注目点:次に必要なのは、作業ごとの検証だ。正しい文章を選べるか、ページの重要な操作部品を残せるか、重要なメールを適切に順位付けできるか、日常的な利用で不確かなケースをどう扱うか。動作の速いデモだけでは、こうした疑問には答えられない。

ウェブページ整理ツールが示す役割分担

KitzeのUnclutterブラウザー拡張機能は、役割分担が最もよく分かる例だ。そのプロジェクトのREADMEによると、拡張機能はページ内の候補要素を抽出し、Jevに不要な要素を判断させる。その後、ブラウザー側のコードが元に戻せる非表示ルールを適用し、ページのテンプレートごとに保存する。次回からはモデルを呼び出さずにルールを再適用する。ユーザーは拡張機能を一時停止したり、要素を表示したままにしたり、ページを再分析したりできる。Cookieのオーバーレイを隠す場合はあるが、ユーザーに代わって「同意する」または「拒否する」を押すことはない。

これは重要な境界だ。Jevはある要素を余計な表示だと判断できるが、ブラウザー自体を操作したり、同意の選択を入力したり、ルールの有効期間を決めたりはしない。実用上の評価では、整理後もナビゲーション、アクセシビリティ機能、ペイウォールの通知、本来の同意オプションを使えるか確認する必要がある。このプロジェクトはソースからのビルドと、利用者自身のAPIキーを使う設定を提供するが、READMEにはこうした誤りを独立して実地調査した結果はない。

「Made with Jevのウェブサイト検出ツール」は、Bermanの動画の3分29秒で紹介されているが、別の処理手順を採る。同サイトの説明によると、ブラウザーが表示スタイルを測定し、DeepSeek V4 Flashがスクリーンショットを説明し、Jevが所定の兆候をもとにデザインとコピーを判定した後、DeepSeekが短い評価文を作成する。同サイトはanthropic.comに「スロップ」スコア26%を表示する。これはサイト独自の評価基準で算出したスタイル上のスコアだ。動画中でBermanはAnthropicのサイトについて推測しているが、このスコアからサイトのどれほどがAIで書かれたかは分からない。

情報の順位付けは別種の判断

Jonathan Unikowskiの受信箱デモは、受信日時の逆順をリアルタイムの重要度順に置き換える案を示している。Unikowskiの投稿によると、この機能はAvecに「近日追加予定」だ。導入済みの受信箱、重要度の定義、緊急メールを見落とす頻度の独立した測定については説明されていない。メールの取得、表示順の提示、アーカイブ、ラベル付け、送信の判断は、引き続きアプリが担う。実演でJevが行うのは優先順位付けだ。

Shubham SabooのNeedle拡張機能は、その違いをより分かりやすく示す。Sabooによると、Jevがページ上の文章を読者の検索語に照らして採点し、拡張機能が一致する箇所をその場で強調表示する。彼の詳しい説明によると、Needleは回答文を作成しない。強調される文章は、もともとページ内にあるものだ。これによりページ内検索で探せる対象が変わるが、強調箇所が誤っている可能性は残る。検証では正しい箇所が分かっている検索語を使い、似ているが内容が矛盾する記述を含むページも試す必要がある。

Burhan Usmanのクリップ作成に関する投稿は、90分を超える動画から話題に関係する場面を見つけたとしている。動画の8分34秒の箇所でBermanは、システムがおそらく文字起こしを使っていると述べる。これは処理手順の確認が取れた説明ではなく、Bermanの推測だ。投稿にはJevへの正確な入力や出力が記されていない。クリップ作成アプリは、元の素材を取得し、時間の境界を決め、ダウンロード可能な動画を作る必要がある。投稿にある所要時間と費用は開発者一人の報告であり、精度試験や最初から最後までの処理内容の内訳は公開されていない。

UIの組み立てでアプリが担うこと

Chris Tateのjson-render実験では、アプリ側が用意した選択肢からユーザーインターフェースを組み立てる。Jevに関するプロジェクトの文書は、役割を特に明確に説明している。Jevはコンポーネントと配置位置を選び、コードが仕様を組み立てて検証し、レンダラーが画面に表示する。プレイグラウンドの業務データは合成データで、操作処理はユーザーが画面を操作した時に実行される。つまり、実演が示すのは制約されたインターフェースの組み立て方であり、モデルが独力でウェブサイトを作成し公開することではない。

創作に関する2つの例は、比較的リスクの低い選択を扱う。Matt DesLauriersの色彩実験では、ビジュアルデモの中でテキストの指示をカラーパレットに対応づける。Stefanの絵文字実験は、9分52秒の箇所で紹介され、入力されたテキストに合う絵文字を順位付けする。どちらもアプリが選択可能なビジュアル素材を表示する例だ。投稿が示すのは操作のアイデアであり、選択がブランドに適しているか、コントラスト要件を満たすか、言語や状況が異なっても機能するかまでは立証していない。

TypeSafeのドキュメントは、こうした例に共通点がある理由を説明している。Jevは、与えられた状態に基づいて型付きのChoice、Score、yes/no形式の質問を評価する。ChoiceとScoreは確率分布と信頼度を返し、ソフトウェアはそれを独自のルールに使える。同社は実際の作業で閾値をテストするよう推奨している。信頼度の値そのものは、独立した精度評価ではない。

これらの例は、固定ルールでは柔軟性に欠ける場面で、ソフトウェアが小さくタイミングの合った質問をできるという設計パターンを示している。個々のツールが日常業務に役立つかどうかは、どのような誤りをするか、何を表示または非表示にするか、ユーザーがやり直せる手段をアプリが用意しているかによって決まる。モデルの判断だけではなく、ワークフロー全体を評価する必要がある。