Acht Beispiele aus dem Septembervideo von Matthew Berman bringen TypeSafe AIs Modell Jev in vertraute Aufgaben: eine Webseite aufräumen, eine Passage finden, einen Posteingang sortieren und Elemente einer Benutzeroberfläche auswählen. Die Demonstrationen stammen von unterschiedlichen Entwicklern. Gemeinsam ist ihnen, dass sie dem Modell eine eng umrissene Beurteilung überlassen, während die Anwendung Eingaben zusammenstellt und das Ergebnis umsetzt.
Jeder Clip wird aufschlussreicher, wenn man die Entscheidung von der Arbeit trennt, die im Code oder von einem anderen Modell erledigt wird. Ebenso wichtig wie der Modellaufruf ist der mögliche Fehler, den Nutzer bemerken würden. Es sind Demonstrationen und frühe Werkzeuge; BIG CHANGE hat weder ihre Genauigkeit noch ihre Zuverlässigkeit im Alltag unabhängig geprüft.
Die große Veränderung
- Was sich geändert hat: Entwickler integrieren ein strukturiertes KI-Urteil in bestehende Abläufe – von einer Browser-Verknüpfung bis zur Posteingangsansicht. Jev gibt eine Auswahl, Bewertung oder Wahrscheinlichkeit zurück; die Anwendung stellt die möglichen Inhalte bereit und setzt die Antwort um.
- Warum das wichtig ist: Eine hilfreiche Entscheidung lässt sich genau beim Lesen, Suchen oder Sortieren treffen, ohne die gesamte Aufgabe einer Chat-Oberfläche zu übertragen. Zugleich tragen die Anwendungsanbieter Verantwortung für falsche Rangfolgen, ausgeblendete Inhalte und unbeabsichtigte Handlungen.
- Worauf zu achten ist: Als Nächstes braucht es aufgabenspezifische Belege: Wählen diese Werkzeuge die richtige Passage aus? Bleiben wichtige Bedienelemente der Seite erhalten? Werden wichtige E-Mails gut eingeordnet? Wie gehen sie im Alltag mit unsicheren Fällen um? Eine schnelle Demonstration beantwortet diese Fragen nicht.
Ein Seitenbereiniger zeigt die Arbeitsteilung
Kitze’ Browser-Erweiterung Unclutter ist das deutlichste Beispiel. In der Projekt-README heißt es, dass die Erweiterung mögliche Seitenelemente extrahiert und Jev fragt, welche davon entbehrlich sind. Der Browsercode blendet diese Elemente anschließend mit umkehrbaren Regeln aus, speichert die Regeln anhand einer Seitenvorlage und wendet sie erneut an, ohne das Modell nochmals aufzurufen. Nutzer können die Erweiterung pausieren, ein Element sichtbar lassen oder eine Seite neu analysieren. Cookie-Hinweise lassen sich ausblenden, aber die Erweiterung klickt nicht für den Nutzer auf „Akzeptieren“ oder „Ablehnen“.
Das ist eine wichtige Grenze. Jev kann ein Element als störend einstufen; es kontrolliert weder den Browser noch trifft es Einwilligungsentscheidungen oder bestimmt, wie lange eine Regel gilt. Eine praktische Evaluation müsste prüfen, ob Navigation, Barrierefreiheitsfunktionen, Bezahlschranken-Hinweise und echte Einwilligungsoptionen nach dem Bereinigen weiter nutzbar sind. Das Projekt stellt Quelltext-Builds und eine Konfiguration mit eigenem API-Schlüssel bereit. Die README enthält jedoch keine unabhängige Feldstudie zu solchen Fehlern.
Der Webseiten-Detektor „Made with Jev“, gezeigt bei 3:29 in Bermans Video, verwendet eine andere Verarbeitungskette. Laut eigener Beschreibung misst ein Browser die gerenderten Stile, DeepSeek V4 Flash beschreibt Screenshots, Jev bewertet Gestaltung und Texte anhand einer Liste typischer Merkmale, und DeepSeek verfasst das kurze Urteil. Die Website zeigt für anthropic.com einen „Slop“-Wert von 26 Prozent an. Das ist der Stilwert des Werkzeugs nach seiner eigenen Bewertungsrubrik. Es belegt nicht, wie viel der Anthropic-Website mit KI geschrieben wurde, auch wenn Berman dies im Video vermutet.
Informationen zu ordnen ist eine andere Art von Entscheidung
Jonathan Unikowskis Posteingangs-Demo schlägt vor, die umgekehrt chronologische Reihenfolge durch eine laufend aktualisierte Wichtigkeitsrangfolge zu ersetzen. In seinem Beitrag heißt es, die Funktion komme zu Avec. Er dokumentiert weder einen eingeführten Posteingang noch eine Definition von Wichtigkeit oder eine unabhängige Messung übersehener dringender Nachrichten. Die Anwendung müsste weiterhin E-Mails abrufen, die Reihenfolge anzeigen und entscheiden, ob etwas archiviert, markiert oder versendet wird. Jevs demonstrierte Rolle besteht in der Priorisierung.
Shubham Sabooos Needle-Erweiterung macht die Unterscheidung deutlicher. Saboo zufolge bewertet Jev Textpassagen einer Seite anhand der Suchanfrage und die Erweiterung hebt passende Textstellen direkt auf der Seite hervor. In seiner ausführlicheren Erklärung heißt es, Needle formuliere keine Antwort: Der hervorgehobene Satz steht bereits auf der Seite. Dadurch kann eine Suchfunktion nach anderen Inhalten suchen; dennoch kann die Markierung falsch sein. Für Tests braucht man Suchanfragen mit bekannten richtigen Passagen, auch auf Seiten mit ähnlichen, aber widersprüchlichen Aussagen.
Burhan Usmans Beitrag zum Ausschneiden von Videoclips berichtet, dass er thematisch passende Clips in einem mehr als 90 Minuten langen Video gefunden habe. Im Videosegment bei 8:34 vermutet Berman, dass das System wahrscheinlich ein Transkript verwendet; das ist seine Schlussfolgerung und keine bestätigte Beschreibung der Verarbeitungskette. Der Beitrag nennt Jevs genaue Eingaben und Ausgaben nicht. Eine Clip-Anwendung muss weiterhin das Ausgangsmaterial beschaffen, Zeitgrenzen bestimmen und herunterladbare Clips erstellen. Die Angaben zu Zeit und Kosten stammen von einem Entwickler; ein veröffentlichter Genauigkeitstest oder eine Aufschlüsselung des gesamten Ablaufs fehlt.
Was die Zusammensetzung einer Benutzeroberfläche der Anwendung überlässt
Chris Tates json-render-Experiment setzt eine Benutzeroberfläche aus von der Anwendung vorgegebenen Optionen zusammen. Die Jev-Dokumentation des Projekts ist ungewöhnlich eindeutig: Jev wählt Komponenten und Positionen im Layout; Code setzt die Spezifikation zusammen und validiert sie; der Renderer zeigt sie an. Die Geschäftsdaten im Playground sind synthetisch, und Aktionshandler werden erst durch eine Interaktion des Nutzers ausgeführt. Die Demonstration zeigt somit eine Möglichkeit, eine begrenzte Benutzeroberfläche zusammenzustellen – nicht, dass ein Modell unabhängig eine Website schreibt und veröffentlicht.
Die beiden kreativen Beispiele betreffen Entscheidungen mit geringeren Folgen. Matt DesLauriers’ Farbexperiment ordnet Textvorgaben in einer visuellen Demo Farbpaletten zu. Stefans Emoji-Experiment, gezeigt bei 9:52, ordnet Emojis zu eingegebenem Text. In beiden Fällen zeigt eine App auswählbares Bildmaterial. Die Beiträge veranschaulichen Interaktionsideen; sie belegen nicht, dass die Auswahl zu einer Marke passt, Kontrastanforderungen erfüllt oder in verschiedenen Sprachen und Kontexten funktioniert.
TypeSafes Dokumentation erklärt, warum diese Beispiele eine gemeinsame Struktur haben. Jev bewertet typisierte Fragen der Kategorien Choice, Score und Ja/Nein anhand eines bereitgestellten Zustands. Choice und Score geben Wahrscheinlichkeitsverteilungen und einen Konfidenzwert zurück, die Software in eigenen Regeln verwenden kann. Das Unternehmen empfiehlt, Schwellenwerte für die konkrete Aufgabe zu testen; ein Konfidenzwert ist kein unabhängiges Genauigkeitsergebnis.
Die Beispiele liefern gute Argumente für ein Entwurfsmuster: Software kann genau dann eine kleine, gezielte Frage stellen, wenn eine feste Regel zu starr wäre. Ob ein bestimmtes Werkzeug im Alltag sinnvoll ist, hängt von seinen Fehlern, den dadurch offengelegten oder ausgeblendeten Inhalten und den Möglichkeiten ab, die Folgen rückgängig zu machen. Das sind Eigenschaften des gesamten Arbeitsablaufs, nicht allein der Modellentscheidung.



