Delapan contoh dalam video Matthew Berman pada 24 September menempatkan model Jev dari TypeSafe AI dalam tugas yang akrab: merapikan halaman web, menemukan bagian teks, mengurutkan kotak masuk, dan memilih bagian antarmuka. Demonstrasi ini berasal dari beberapa pembuat. Pola umumnya adalah memberi model tugas penilaian yang sempit, sementara aplikasi mengumpulkan masukan dan menjalankan hasilnya.

Setiap klip menjadi lebih informatif jika keputusannya dipisahkan dari pekerjaan yang dilakukan dalam kode atau oleh model lain. Jenis kesalahan yang akan terlihat oleh pengguna juga penting. Ini adalah demonstrasi dan alat tahap awal; BIG CHANGE belum menguji sendiri akurasi atau keandalannya dalam penggunaan sehari-hari.

Perubahan besar

  • Yang berubah: Para pembuat menyisipkan penilaian AI bertipe ke dalam interaksi perangkat lunak yang sudah ada, mulai dari pintasan peramban hingga tampilan kotak masuk. Jev mengembalikan pilihan, skor, atau probabilitas; aplikasi menyediakan bahan kandidat dan bertindak berdasarkan jawaban tersebut.
  • Mengapa ini penting: Keputusan yang berguna dapat dibuat saat seseorang sedang membaca, mencari, atau memilah, tanpa menyerahkan seluruh tugas kepada antarmuka obrolan. Desain yang sama membuat pemilik aplikasi bertanggung jawab atas pemeringkatan yang keliru, konten tersembunyi, dan tindakan yang tidak disengaja.
  • Yang perlu dicermati: Bukti berikutnya perlu spesifik pada tugas: apakah alat ini memilih bagian teks yang tepat, mempertahankan kendali halaman yang penting, mengurutkan email penting dengan baik, dan menangani kasus yang tidak pasti dalam penggunaan biasa. Demonstrasi cepat saja tidak dapat menjawab pertanyaan tersebut.

Pembersih halaman menunjukkan pembagian tugas

Ekstensi peramban Unclutter buatan Kitze adalah contoh paling jelas. README proyeknya menyebut ekstensi itu mengekstrak elemen halaman kandidat dan meminta Jev menentukan mana yang tidak penting. Kode peramban kemudian menerapkan aturan penyembunyian yang dapat dibatalkan, menyimpannya berdasarkan templat halaman, dan menerapkan ulang aturan itu tanpa permintaan model baru. Pengguna dapat menjeda ekstensi, mempertahankan elemen agar tetap terlihat, atau menganalisis ulang halaman. Lapisan cookie mungkin disembunyikan, tetapi ekstensi tidak menekan Terima atau Tolak bagi pengguna.

Itulah batas yang berdampak. Jev dapat menilai suatu elemen sebagai gangguan; model tidak menguasai peramban, menulis pilihan persetujuan, atau menentukan berapa lama aturan berlaku. Evaluasi praktis perlu memeriksa apakah navigasi, kendali aksesibilitas, pemberitahuan paywall, atau opsi persetujuan yang sah tetap dapat digunakan setelah pembersihan. Proyek ini menawarkan build dari sumber dan pengaturan dengan kunci milik pengguna, tetapi README-nya tidak menyediakan studi lapangan independen mengenai kesalahan tersebut.

Alat detektor situs Made with Jev, yang ditampilkan pada menit 3:29 dalam video Berman, memakai alur berbeda. Metodenya sendiri menyebut peramban mengukur gaya hasil render, DeepSeek V4 Flash menguraikan tangkapan layar, Jev menilai desain dan teks berdasarkan daftar ciri, lalu DeepSeek menulis kesimpulan singkat. Situs itu menampilkan skor “slop” 26% untuk anthropic.com. Itu adalah skor gaya dari rubriknya sendiri. Skor tersebut tidak membuktikan seberapa banyak situs Anthropic ditulis oleh AI, meskipun Berman menyimpulkan demikian dalam videonya.

Pemeringkatan informasi adalah jenis keputusan yang berbeda

Demo kotak masuk Jonathan Unikowski mengusulkan penggantian urutan kronologis terbalik dengan pemeringkatan kepentingan langsung. Unggahannya menyebut fitur tersebut “akan hadir di” Avec. Unggahan itu tidak mendokumentasikan kotak masuk yang telah diterapkan, definisi kepentingan, atau pengukuran independen atas pesan mendesak yang terlewat. Aplikasi tetap mengambil email, menampilkan urutannya, dan memutuskan apakah sesuatu diarsipkan, diberi label, atau dikirim; peran Jev yang didemonstrasikan adalah menentukan prioritas.

Ekstensi Needle buatan Shubham Saboo memperjelas perbedaannya. Saboo menyatakan Jev memberi skor pada bagian-bagian halaman berdasarkan kecocokan dengan kueri pembaca, lalu ekstensi menyorot teks yang cocok langsung di halaman. Penjelasannya yang lebih panjang menyebut Needle tidak menulis jawaban: kalimat yang disorot sudah ada di halaman. Ini mengubah sasaran pencarian pintasan temukan, tetapi kalimat yang disorot tetap bisa keliru. Pengujian memerlukan kueri dengan bagian yang benar sudah diketahui, termasuk halaman yang memuat pernyataan serupa tetapi saling bertentangan.

Unggahan pemotongan klip oleh Burhan Usman melaporkan penemuan klip tentang suatu topik dalam video berdurasi lebih dari 90 menit. Pada bagian video di menit 8:34, Berman mengatakan sistem itu kemungkinan menggunakan transkrip; itu adalah kesimpulannya, bukan uraian alur kerja yang terverifikasi. Unggahan tersebut tidak merinci masukan atau keluaran Jev. Aplikasi pemotongan klip tetap harus memperoleh materi sumber, menentukan batas waktu, dan menghasilkan klip yang dapat diunduh. Waktu dan biayanya dalam unggahan merupakan laporan satu pembuat, tanpa uji akurasi atau perincian pekerjaan ujung-ke-ujung yang dipublikasikan.

Apa yang masih dikerjakan aplikasi dalam penyusunan UI

Eksperimen json-render Chris Tate menyusun antarmuka pengguna dari opsi yang dimiliki aplikasi. Dokumentasi Jev proyek tersebut sangat jelas: Jev memilih komponen dan posisi tata letak; kode menyusun dan memvalidasi spesifikasi; perender menampilkannya. Data bisnis di playground bersifat sintetis, dan penangan tindakan berjalan saat pengguna berinteraksi. Jadi, demonstrasi ini menunjukkan cara menyusun antarmuka dengan batasan, bukan model yang secara mandiri menulis dan menerapkan situs web.

Dua contoh kreatif mengeksplorasi pilihan dengan risiko lebih rendah. Eksperimen warna Matt DesLauriers memetakan perintah teks ke palet dalam demo visual. Eksperimen emoji Stefan, yang ditampilkan pada menit 9:52, memberi peringkat emoji berdasarkan teks bertipe. Dalam kedua kasus, aplikasi menampilkan materi visual yang dapat dipilih. Unggahan tersebut menunjukkan gagasan interaksi; tidak membuktikan bahwa pilihannya sesuai dengan merek, memenuhi persyaratan kontras, atau berfungsi lintas bahasa dan konteks.

Dokumentasi TypeSafe menjelaskan kemiripan keluarga pada contoh-contoh ini. Jev mengevaluasi pertanyaan bertipe Choice, Score, dan ya/tidak berdasarkan keadaan yang diberikan. Choice dan Score mengembalikan distribusi serta nilai keyakinan yang dapat digunakan perangkat lunak dalam aturannya sendiri. Perusahaan merekomendasikan pengujian ambang batas pada tugas sebenarnya; kolom keyakinan bukan hasil pengukuran akurasi independen.

Contoh-contoh itu mendukung sebuah pola desain yang masuk akal: perangkat lunak dapat mengajukan pertanyaan kecil dan tepat waktu ketika aturan tetap terlalu kaku. Apakah alat tertentu layak digunakan dalam pekerjaan sehari-hari bergantung pada jenis kesalahannya, apa yang ditampakkan atau disembunyikannya, dan apakah aplikasi memberi pengguna cara untuk memulihkan keadaan. Semua itu adalah sifat dari alur kerja secara keseluruhan, di luar keputusan model saja.