1. 三个不同的东西
JavaScript 在浏览器里执行,用来读取 DOM。JSON 记录页面文字、元素及问题,通过 HTTP 发给 Jev。这里没有把网页转换成 Java 程序。
Choice 是问题类型。CLICK / TYPE_TEXT / SCROLL_DOWN 是操作题的候选答案。SCROLL 也由一道 Choice 决定。
鼎好 FMG / AI 技术学习网页 → 可见元素 → JSON 选择题 → Jev 回答 → 浏览器动作 → 再观察
左边是本地教学网页,右边是原版提取脚本的结果。JavaScript 负责读取 DOM;JSON 是之后发给 Jev 的数据格式。
更改上方选项后,点“重新提取”。也可以在左侧输入文字或滚动,再提取比较。
JavaScript 在浏览器里执行,用来读取 DOM。JSON 记录页面文字、元素及问题,通过 HTTP 发给 Jev。这里没有把网页转换成 Java 程序。
Choice 是问题类型。CLICK / TYPE_TEXT / SCROLL_DOWN 是操作题的候选答案。SCROLL 也由一道 Choice 决定。
snapshot.js 找按钮、链接、输入框等控件,排除隐藏、禁用、密码与文件输入等;控件中心必须在视口内。保留角色、标签、当前值、状态、位置与内部节点标识。可见文字上限 6,000 字符;普通候选动作最多 250 个,截断数单独记录。
model.py 再把同一 DOM 节点的 fill / click 合并成一个元素编号,并为不同操作列出合法目标。位置、DOM 引用与保护数据留在执行端,Jev 接收精简 elements。
operation 问“下一步做什么”;click_target 问“如果点击,点哪个”;type_text_target 问“如果输入,填哪个”。页面有下拉选择时还会有 select_target。
这些题基于同一状态分别作答,目标题不是先看了 operation 答案才回答。程序只读取最终选中操作对应的目标。未采用的题并不产生动作。
每题返回 choice、probabilities、confidence。confidence 描述概率分布的集中程度,不是任务正确率。Jev 不返回文字思维过程;本页的中文说明明确是助手解读。
读取“回答”页可查看所有候选和概率,包括未采用的目标题。合法输出仍可能作出不合适的动作,因此还需要页面核验。
Jev 选择输入框,但不生成搜索词。官方实现用独立文本模型;这次历史试验通过本地桥接让当前 Codex 提供 Elon Musk。浏览器实际执行输入、点击、选择或鼠标滚轮事件。
SCROLL_DOWN 的 560 像素来自代码预设。页面发生变化时先拒绝过期决定,重新观察,不盲目重试点击。执行后先记动作,再读取结果。
代码把无限网页操作缩成当前可观察、可执行的候选;模型不生成选择器、脚本或任意浏览器命令。操作与目标同批提问减少串行往返,这是架构上的设计理由。
本学习台没有新跑速度基准,不证明“UltraFast”在每个网站都更快。旧记录中还有文字交接等待、动态页面与两次 StalePage,不能只看模型接口延迟。
适合学习结构化网页代理、排查“选了但没执行”、核对目标映射。采用真实请求与回答、原版 DOM 提取器和可复查编号;没有把历史返回包装成今天的实时调用,没有为 Google 编造概率,也没有从源码推测模型内部思维。
Google → X 的前四步只作教学示例,旧记录中仅有 Google 准备阶段的局部操作记录,没有对应 Jev 请求。X 的中间步骤没有逐帧截图,控件位置图依据真实 DOM 快照重建;公开版已省略包含登录账号画面的阶段末截图;原版仅在本地保留。没有新执行完整联网任务、调用 Jev、量化提速或证明稳定成功率。本地实验页不是 Google / X 的实际页面。