AI-translated from English; not yet reviewed by a fluent editor.

# Jev 演示：AI 决策如何融入日常软件

> 八个 Jev 演示展示了：在现有应用中，经过结构化的 AI 决策如何用于排序、选择或筛选。我们梳理了周边软件仍承担哪些工作，以及哪些方面尚未得到验证。

By BIG CHANGE Editorial

Published: 2026-09-24T22:47:28.571Z
Updated: 2026-09-24T22:47:28.571Z
Canonical: https://bigchange.ai/blog/jev-demos-ai-decisions-everyday-software

![Charcoal illustration of a desktop monitor showing a generic web article with one passage highlighted in orange.](https://bigchange.ai/api/media/file/jev-find-in-page-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

在[Matthew Berman 于 9 月 24 日发布的视频](https://www.youtube.com/watch?v=jGD_UR4wMJc)中，八个示例将 TypeSafe AI 的 Jev 模型用于一些常见任务：清理网页、查找段落、排列收件箱，以及选择界面元素。这些演示来自不同的开发者。它们采用了相同的做法：让模型作出范围明确的判断，再由应用收集输入并执行结果。

将决策与代码或其他模型完成的工作区分开来，每段演示才更有参考价值。用户能够察觉到的潜在错误，同模型调用本身同样重要。这些只是演示和早期工具；BIG CHANGE 尚未独立测试其准确性或日常可靠性。

## 重大变化

- **变化内容：**开发者正把结构化的 AI 判断嵌入现有软件交互中，从浏览器快捷操作到收件箱视图皆是如此。Jev 返回一个选项、分数或概率；应用负责提供候选材料并根据回答采取行动。
- **为何重要：**用户阅读、搜索或整理内容时，软件即可在当下作出有用判断，无需将整个任务交给聊天界面。同一设计也意味着应用所有者必须对错误排序、内容被隐藏和意外操作负责。
- **关注事项：**接下来要看针对具体任务的证据：这些工具能否选中正确段落、保留页面上的必要控件、合理排列重要邮件，并在日常使用中处理不确定情况。仅凭快速演示无法回答这些问题。

## 网页清理工具展示了职责如何划分

[Kitze 的 Unclutter 浏览器扩展](https://x.com/thekitze/status/2100595129874817340)是最清楚的例子。其[项目 README](https://github.com/kitze/unclutter)指出，扩展会提取网页元素作为候选项，再让 Jev 判断哪些内容并非必要。随后，浏览器代码应用可撤销的隐藏规则，按网页模板保存，并在不再次请求模型的情况下重新应用。用户可以暂停扩展、指定保留某个元素，或重新分析页面。扩展可能隐藏 Cookie 弹窗，但不会替用户点击“接受”或“拒绝”。

这是一个影响重大的界限。Jev 可以判断某个元素是否属于干扰内容，但它并不掌控浏览器，不会填写同意选项，也不会决定规则保留多久。实际评估应检查清理后导航、无障碍控件、付费墙提示或真正的同意选项是否仍然可用。该项目提供源代码构建版本和自带密钥的设置方式，但 README 没有提供针对这些错误的独立实地研究。

这个[Jev 制作的网站检测器](https://madewithjev.com/free-tools/ai-slop-detector)则采用了另一套流程；在[Berman 视频的 3:29 处](https://www.youtube.com/watch?v=jGD_UR4wMJc&t=209s)，演示展示了该工具。其方法说明称：浏览器会测量渲染样式，DeepSeek V4 Flash 描述截图，Jev 根据一组特征判断设计和文案，DeepSeek 再撰写简短结论。网站给 anthropic.com 标出了 26% 的“AI 垃圾”分数。这是该工具按照自身标准计算出的风格评分，并不能证明 Anthropic 网站有多少内容由 AI 撰写，尽管 Berman 在视频中作出了这种推断。

## 信息排序是另一类判断

[Jonathan Unikowski 的收件箱演示](https://x.com/jnnnthnn/status/2101399331115077760)提出用实时重要性排序取代按时间倒序排列。他的帖子称该功能“即将推出”，将加入 Avec。帖子没有说明这是已经部署的收件箱、重要性的定义，也没有提供漏掉紧急邮件的独立测量结果。应用仍需负责获取邮件、展示顺序，并决定是否归档、加标签或发送邮件；演示中的 Jev 负责的是优先级排序。

[Shubham Saboo 的 Needle 扩展](https://x.com/Saboo_Shubham_/status/2101576462042366114)让这一区别更容易看清。Saboo 称，Jev 会根据读者的查询为网页段落评分，扩展则会在原位置高亮匹配文本。他的[详细说明](https://www.linkedin.com/posts/shubhamsaboo_introducing-a-new-way-to-find-f-withtypesafe-activity-7507513455138979841-CY8S)指出，Needle 不会撰写答案：高亮的句子本来就存在于页面上。这改变了“查找”快捷操作能够搜索的内容，但高亮的句子仍有可能不正确。测试应使用答案段落已知的查询，包括页面上存在相似却相互矛盾陈述的情形。

[Burhan Usman 的视频剪辑帖子](https://x.com/BurhanUsman/status/2101641842441732297)称，他在一段超过 90 分钟的视频中找到了与某个主题相关的片段。在[视频 8:34 处](https://www.youtube.com/watch?v=jGD_UR4wMJc&t=514s)，Berman 表示系统可能使用了文字稿；这是他的推测，并非经核实的流程说明。该帖子没有列出 Jev 的确切输入或输出。剪辑应用仍须获取源素材、确定时间边界并生成可下载的片段。相关耗时和成本来自一位开发者的报告，未附公开的准确性测试或端到端工作拆分。

## 界面组合留下哪些工作由应用完成

[Chris Tate 的 json-render 实验](https://x.com/ctatedev/status/2101022101750571357)使用由应用提供的选项组装用户界面。[项目中的 Jev 文档](https://github.com/vercel-labs/json-render/blob/main/apps/web/lib/jev/README.md)对职责划分说明得相当明确：Jev 选择组件和布局位置；代码负责组装并验证规格；渲染器负责显示。Playground 中的业务数据是合成数据，操作处理程序则在用户交互时运行。因此，该演示展示的是一种组合受限界面的方法，而非模型独立编写并部署网站。

两个创意示例探索了风险较低的选择。[Matt DesLauriers 的颜色实验](https://x.com/mattdesl/status/2100899669802963060)将文字提示映射为可视化演示中的调色板。[Stefan 的表情符号实验](https://x.com/heystefan_/status/2101369117496521042)在[9:52 处](https://www.youtube.com/watch?v=jGD_UR4wMJc&t=592s)展示了根据输入文字为表情符号排序。两个案例中，应用都会展示可供选择的视觉素材。这些帖子展示的是交互构想，并不能证明相应选择适合某个品牌、符合对比度要求，或能适用于各种语言和场景。

TypeSafe 的[文档](https://docs.typesafe.ai/introduction)解释了为何这些示例有共同特点。Jev 会根据提供的状态，评估带有类型的 Choice、Score 以及是／否问题。Choice 和 Score 会返回分布及置信度，供软件用于自身规则。该公司[建议在实际任务中测试阈值](https://docs.typesafe.ai/confidence)；置信度字段本身并不是独立的准确性结果。

这些示例有力地展示了一种设计模式：当固定规则过于僵化时，软件可以在合适的时机提出一个范围明确的小问题。某个工具是否适合日常工作，取决于它会犯哪些错误、会显示或隐藏什么，以及应用是否让用户能够恢复。要评估这些方面，必须看完整工作流，不能只看模型的判断。

## Sources

- [Matthew Berman：8 个 Jev 用例，效果堪比作弊](https://www.youtube.com/watch?v=jGD_UR4wMJc) — 这段 10:38 的视频汇集了不同开发者的八个演示。我们检查了完整的英文自动字幕和章节列表。5:17 至 6:31 的 Zapier 部分为赞助内容。该视频不是独立的产品验证。
- [TypeSafe AI：System One Models 与 Jev 介绍](https://typesafe.ai/blog/introducing-system-one-models-and-jev) — 官方早期访问公告及结构化模型决策说明。性能结果来自公司测试，且附有其声明的局限；本文没有将这些结果用作八个演示的基准。
- [TypeSafe AI：Introduction 与 Confidence 文档](https://docs.typesafe.ai/introduction) — 说明 Jev 的输入状态以及 Choice、Score 和 Noul 问题类型。配套的 Confidence 页面解释，Choice 和 Score 的置信度是根据答案分布推导得出，操作阈值需要针对用户的具体任务进行测试。
- [TypeSafe AI：Confidence](https://docs.typesafe.ai/confidence) — 说明答案概率、推导出的置信度和针对具体任务的操作阈值之间的区别。该文档不能证明本文任何演示的准确性。
- [Made with Jev：AI Slop Detector](https://madewithjev.com/free-tools/ai-slop-detector) — 工具制作者介绍了浏览器测量、DeepSeek 对截图的观察、Jev 的判断以及由 DeepSeek 单独撰写的结论。anthropic.com 示例的 26% 是依据网站风格标准给出的评分，并非 AI 创作内容的证据。
- [Kitze：Unclutter 公告与源代码](https://github.com/kitze/unclutter) — 开发者原始 README 介绍了 Jev 对候选内容的分类、可撤销的本地隐藏规则、模板复用和用户控制。9 月 17 日发布的原帖为 https://x.com/thekitze/status/2100595129874817340. 未发现独立的实时场景评估。
- [Jonathan Unikowski：Jev 收件箱优先级排序](https://x.com/jnnnthnn/status/2101399331115077760) — 开发者展示实时重要性排序，并表示该功能即将加入 Avec。这能证明有此演示和拟议发布计划，但不能证明收件箱已部署或其优先级准确性已得到测量。
- [Shubham Saboo：Needle 语义化页内查找](https://x.com/Saboo_Shubham_/status/2101576462042366114) — 开发者介绍了一个开源 Chrome 扩展。他在较长的 LinkedIn 说明中称，Jev 会为页面上已有的段落评分，扩展则将其高亮，而不会生成替代答案；没有提供独立的检索评估。
- [Chris Tate：json-render 与 Jev 实验](https://github.com/vercel-labs/json-render/blob/main/apps/web/lib/jev/README.md) — 项目文档称，Jev 从应用提供的界面候选项中作出选择，代码负责组装并验证规格，渲染器负责显示。原始的 9 月 18 日演示帖子为 https://x.com/ctatedev/status/2101022101750571357. Playground 使用合成数据。
- [Burhan Usman：按主题剪辑视频的演示](https://x.com/BurhanUsman/status/2101641842441732297) — 开发者称，他按主题剪辑了一段超过 90 分钟的视频。该帖子没有披露完整流程、经过验证的时间边界或片段准确性；Berman 在视频中对使用文字稿的解释属于推断。
- [Matt DesLauriers：Jev 颜色实验](https://x.com/mattdesl/status/2100899669802963060) — 原始视觉实验将文字与调色板配对。这可以证明存在创意演示，但不能证明其适用于生产设计或符合无障碍规范。
- [Stefan：Jev 表情符号实验](https://x.com/heystefan_/status/2101369117496521042) — 原帖和 Berman 视频的 9:52 片段展示了根据输入文字选择表情符号。帖子没有提供可用性或跨语言评估。
