archive index
文章归档
Claude Code 记忆机制拆解:没有向量库,只有文件和加载时机
固定到 2.1.145 版本,拆开 Claude Code 的记忆实现:CLAUDE.md 四层拼接与真实注入形态、auto memory 的两种模式与全量扫描式召回、compact 之后哪些记忆回得来、以及藏在 bundle 里那个每晚跑一次的 dream 整理任务。
Qwen-UI-Agent:把 GUI Agent 的战场从模拟器搬到 100 台真机上
阿里 MAI-UI 团队的 Qwen-UI-Agent 技术报告,用 100+ 台真实手机、150+ 个 App 搭出可调度的真机训练与评测底座,配 409 任务的 MobileWorld-Real 与三分类 AutoJudge。真机 92.2%、AndroidDaily 97.5%,但 OSWorld-Verified 只排第二。拆解它的真机 runtime 工程、GUI+CLI 混合动作实测占比、六类真机失败归因,以及这些东西对 APP 自动化测试的可迁移部分。
Interactive Reward Agent:GUI 任务的判定权,该从截图交回环境状态
IRA 用 propose-then-verify 框架重做 GUI 任务评测——先把指令拆成显式完成条件,再调系统/应用/GUI 工具去环境里取证。在 321 条轨迹的 GUI-RewardBench 上做到 86.9% 准确率,比最强的截图评测器高 8.1 个百分点;用它替代人工评测脚本做 RL 奖励,OSWorld 成功率 34.0% 对 34.9%。拆解它的条件分解机制、工具取证代价,以及对 APP 自动化测试 oracle 设计的直接启发。
Superpowers 拆解:7169 行 Markdown 怎么变成 Coding Agent 的强制规程
obra/superpowers 没有一行功能代码,只有 14 个 skill 和几百行 shell。它真正解决的问题不是「写下工程规范」,而是「让一段 prompt 在几小时的长会话里持续生效」——从 SessionStart 硬注入、compact 后重注入,到把状态挪出上下文写进文件。逐层拆开看它怎么做的,以及哪些部分可能被高估。
StateAct:把 Computer-Use Agent 的主循环从『看屏幕』换成『读状态』之后
StateAct 让主 agent 默认通过代码读写程序状态(文件、DOM、数据库、shell),只在任务确实需要视觉交互时才委派一个独立 GUI 子代理去点屏幕。同一个 Claude Opus 4.8 后端,在 OSWorld 2.0 上二值成功率从 20.6% 提到 26.9%,成本从每任务约 72 美元降到约 7.8 美元。拆解它的状态锚定原理、无叙述验证门,以及对 APP 自动化测试 oracle 设计的启发。
State Transition Pretraining:给 GUI Agent 补一条“便宜但结构化”的预训练轴
解析 Scaling GUI Agents with Visual State Transitions(STP):用 (s_t, a_t, s_t+1) 三元组做联合正向/逆向动力学预训练,在 AgentNetBench、AndroidControl、GUIOdyssey 上稳定提升轨迹微调效果,并讨论它对 macOS 研发效率工具与 GUI 自动化训练管线的启发与局限。
OSWorld 2.0:把 Computer-Use Agent 的考卷从 30 步换成 318 步之后
OSWorld 2.0 用 108 个中位耗时 1.6 小时、平均 318 次工具调用的真实长程工作流,把评测重心从『能不能点对按钮』搬到『能不能在几百步里不丢状态』。拆解它的十种挑战现象分类、批处理 vs 单动作的成本-性能权衡,以及对 APP 自动化测试用例设计的启发。
SEE:移动 GUI Agent 缺的不是更多短轨迹,而是可解释的长程交互图
解析 2026 年论文 SEE:Structure-aware Exploring & Exploiting for Long-horizon GUI Agent Trajectory Synthesis。它用 UI transition graph 把移动 App 探索、反思清洗和长程轨迹合成拆开,生成平均 14.8 步、24.63 个元素/屏的高复杂度数据,并讨论它对 APP 自动化测试、移动端 QA、轨迹生成和过程 oracle 的启发。
Codex Memory 实现拆解:不是向量库,而是一套本地异步整理系统
基于 OpenAI Codex 官方 Memories 文档和 openai/codex 源码,系统拆解 Codex Memory 的读写链路:本地 memory store、阶段一 rollout extraction、阶段二 consolidation agent、memory_summary 注入、MEMORY.md 检索、/memories 控制、Chronicle 以及工程边界。
jcode 源码拆解:Coding Agent 的 Memory 不该只是一个向量库
固定到 1jehuang/jcode 的 ccf6153 commit,拆解 jcode 如何把 Memory 做成异步旁路:项目/全局图存储、hybrid retrieval、LLM listwise rerank、pending memory 注入、增量抽取与图维护。
SeerGuard:Mobile GUI Agent 真正危险的不是做错题,而是做错动作
解析 2026 年论文 SeerGuard:它把 mobile GUI agent 的安全防护从事后检查推进到执行前预测,用 instruction-level screening 与基于语义世界模型的 action-level risk assessment,在动作真正落到手机前判断可能后果。文章从 APP 自动化测试、移动端 QA 和 agent 安全护栏视角讨论它的贡献、指标、数据配方与工程边界。
Persome 源码拆解:屏幕活动如何变成可追溯的 HUMAN.md
固定到 Intuition-Lab/personal-model 的一个真实 commit,拆解 Persome 如何采集 Mac 活动、按分钟和会话形成状态、用证据门控生成 Point/Line/Face/Volume/Root,再通过 HUMAN.md 与 MCP 交给人和 Agent 使用。
PalmClaw:把 Mobile Agent 从“点屏幕”改成“直接调手机能力”,值不值得?
解析 2026 年论文 PalmClaw:它把 mobile agent 的执行重心从 GUI 点击序列转到手机端原生 device tools,用显式参数、结构化结果和执行边界管理权限、文件与自动化能力。文章从移动端 QA 和 APP 自动化测试视角讨论它的价值、证据与边界。
EvoCUA-1.5:Computer-Use Agent 的在线 RL 难点在多轮轨迹
解析 2026 年 EvoCUA-1.5:它把 computer-use agent 从离线经验学习推进到可执行环境里的在线强化学习,用 STEPO、policy-aware filtering、DTAC 和异步 rollout 基础设施处理多轮 GUI 任务中的稀疏奖励、上下文管理和训练吞吐问题。文章从 GUI Agent、APP 自动化测试和移动端 QA 视角讨论 verifier、任务调度、失败归因和工程边界。
SCALECUA:Computer-Use Agent 扩展的关键不只是 RL,而是可验证任务
解析 2026 年 SCALECUA:它用 VERIGEN 合成可执行 verifier 的 GUI 任务,再用 Frontier Sampling 和 Visual Context Segmentation 提升在线 RL 效率,在 OSWorld 达到 68.7%、ScienceBoard 达到 54.0%。文章从 GUI Agent、APP 自动化测试和移动端 QA 视角讨论可验证奖励、任务合成、长程轨迹训练和工程边界。
Xiaomi-GUI-0:Mobile GUI Agent 真正难的是跑在真机上
解析 2026 年 Xiaomi-GUI-0 Technical Report:它把 Mobile GUI Agent 的训练、rollout、异常页修复和 RealMobile 评测放进真机闭环,在 RealMobile 上达到 72.0% 成功率、AndroidWorld 上达到 78.9%。文章从移动端 QA 与 APP 自动化测试视角讨论真实设备、异常状态、失败飞轮、自动验证和工程边界。
Learning from Failure:GUI Agent 的失败轨迹,不该只当垃圾丢掉
解析 Stanford/Tsinghua 2026 论文 Learning from Failure:它把 computer-use agent 的自改进从只收集成功轨迹,推进到利用失败轨迹诊断 grounding、循环、知识和工具能力问题,并在 OSWorld 上把 OpenCUA-72B 从 42.3% 提升到 48.9%。文章从移动端 QA 与 APP 自动化测试视角讨论其贡献、证据和工程边界。
UI-MOPD:跨桌面和手机训练 GUI Agent,不能只把数据混在一起
解析 arXiv 2026 论文 UI-MOPD:Multi-Platform On-Policy Distillation for Continual GUI Agent Learning。文章从 GUIAgent 与移动端 QA 视角讨论 Uni-GUI 数据集、多教师 on-policy 蒸馏、OSWorld/MobileWorld 结果,以及跨平台 APP 自动化测试的工程边界。
GUI Agent 真的相信屏幕吗:像素、DOM 与状态信念之间的错位
解析 arXiv 2026 论文 Do GUI Agents Believe Their Eyes?:作者用 310 个真实 web、mobile、desktop 探针诊断多模态 GUI agent 的状态信念到底来自截图还是 DOM/accessibility 等结构化通道,并讨论它对 APP 自动化测试与移动端 QA 的工程启发。
Page Agent:页面内 GUIAgent 的 loop 是怎么实现的
基于 alibaba/page-agent 当前 main commit,拆解 PageAgent 怎样用 DOM 文本观察、单步 AgentOutput 和 PageController 动作执行,跑出一个页面内的 GUIAgent loop。
把任务状态从屏幕里拆出来:TSR 给长程移动端 GUI Agent 挂了一个外置状态机
解析 TSR(Task-State Representation,2026-07-01):它不改 agent、不训模型,而是在固定的 GUI actor 外面挂一个训练无关的状态更新器,用动作前后两张截图对比,持续维护任务摘要、进度追踪和动作校验三块结构化状态。对做 APP 自动化测试的人,这篇最值钱的地方不是又涨了几个点,而是它把长程用例里最难的三件事——目标漂移、进度幻觉、界面延迟导致的死循环——拆成了三个可单独维护、可单独消融的字段。
把动作校验做进像素里:VisCritic 用截图对比给 GUI Agent 当过程裁判
解析 VisCritic(ECCV 2026 投稿):它不改 agent,而是拿一个 Siamese ViT 直接对比动作前后两张截图,判断这一步成没成、错在哪、进度到哪。对 APP 自动化测试来说,这正好切中一个老问题——每一步操作的 oracle 到底该怎么设,以及为什么纯文本断言看不懂界面的视觉变化。
视觉记忆不是加得越多越好:一篇 GUI Agent 失败模式研究给自动化测试的启示
解析 Naive Visual Memory is Not Enough:这篇论文没有堆新 benchmark,而是把 GUI Agent 的失败拆成认知、视觉状态、隐藏操作、grounding 四类,并证明简单堆整屏视觉记忆会降低状态级错误、却推高动作级错误。对 APP 自动化测试来说,它把‘失败归因’和‘记忆该存什么像素’变成了可操作的问题。
PerfDog AI 工具体系拆解:CLI、MCP 与 Skills 是怎么接起来的
基于 PerfDog 当前官方 CLI、远程 MCP schema 和三套 Skills,拆解它如何把本地采集、云端报告分析和 Agent SOP 接成一条性能测试闭环。
AgentScope Java:从 ReActAgent 到生产级 Harness
基于 agentscope-ai/agentscope-java 最新 main commit,拆解 AgentScope Java 如何把 ReAct 循环、事件流、middleware、工具权限、workspace、sandbox、skill 和 subagent 组合成 Java 侧生产级 Agent 框架。
AJ-Bench:让 Judge Agent 进入环境,而不是只读轨迹
拆解 AJ-Bench 如何评测 Agent-as-a-Judge:从 Search、DS、GUI 三类数据构造,到代码里的 pipeline、MCP 工具、轨迹回放、桌面环境交互和 F1 聚合。
Capable but Careless:会用电脑的 Agent,为什么管不住嘴
从 GUIAgent 与移动端 QA 视角解析 AgentCIBench:它把 computer-use agent 的隐私边界问题变成可执行、确定性打分的测评 harness,用 117 个场景测 15 个前沿 agent,平均泄露率 67.9%,只有一个模型落在既能干活又守边界的象限。文章拆解它的三类失败模式、评分设计和防御实验,并讨论这套确定性 oracle 对 APP 端安全测试的直接启发。
CubeSandbox:把 Agent 代码执行放进可治理的 MicroVM
基于 TencentCloud/CubeSandbox 最新 master commit,说明它如何用 E2B 兼容 API、KVM MicroVM、CubeCoW、CubeVS/eBPF、CubeEgress 和 CubeProxy sidecar 组成面向 AI Agent 的沙箱运行平台。
GUICrafter:GUI Agent 的数据飞轮,未必只能靠人工轨迹
解析 2026-06-29 arXiv 论文 GUICrafter:它用海量未标注截图中的交互信号构造 meta-task,再用少量高质量数据做 RL 校准,尝试把 GUI Agent 训练从昂贵人工轨迹推向弱监督预训练。文章从移动端 QA 与 APP 自动化测试视角讨论其贡献、证据和工程边界。
Deep Agents:四个模块背后的实现机制
按官方文档的 Execution environment、Context management、Delegation、Steering 四个模块拆解 langchain-ai/deepagents 的源码实现:middleware、backend protocol、虚拟文件系统、上下文压缩、subagent、HITL 与 LangGraph runtime 如何拼起来。
Argus:GUI Agent 什么时候应该相信自己的点击
从 GUIAgent 与移动端 QA 视角解析 Argus:它把 computer-use agent 的不确定性量化从通用 VLM 校准拉回到可执行 GUI grounding,系统比较 27 种 open-weight UQ 方法、8 种 API-only 方法与 conformal click disks,提醒工程系统不要只看 top-1 坐标,还要判断何时拒绝、复查或交给人。
腾讯混元 PhoneGUI 五篇论文:环境、训练、执行与部署边界怎样拼成手机 Agent 栈
详细拆解腾讯混元 PhoneGUI 方向的 PhonePrivacy、PhoneSafety、PhoneWorld、PhoneHarness、PhoneBuddy 五篇论文:为什么它们不是五个孤立 benchmark,而是在回答手机 Agent 从环境供给、模型训练、运行时执行到隐私安全边界的系统问题。
VISUALSKILL:GUI Agent 的技能库为什么不能只剩文字
从 GUIAgent 与移动端 QA 视角解析 VISUALSKILL:它把应用级技能库从 text-only 文档推进到按需加载的图文混合知识,并用 matched text-only control 证明 UI 图像本身能帮助元素定位和中间状态验证。
MemGUI-Agent:长程 Mobile GUI Agent 的瓶颈,正在从点屏转向上下文治理
从 GUIAgent / mobile QA 视角解析 MemGUI-Agent:ConAct 把历史折叠、UI 记忆和动作生成放进同一个端到端策略,MemGUI-3K 用 2956 条长程轨迹监督模型学习上下文管理,并讨论它对 APP 自动化测试、移动端 QA 与长流程回归的工程启发。
Headroom:把 AI Agent 的上下文压缩做成本地代理层
拆解 chopratejas/headroom:它不是单个压缩算法,而是用 wrap、透明代理、provider-specific live zone、块级压缩器和 CCR,把工具输出压缩变成对 Agent 透明的一层本地基础设施。
MobileForge:Mobile GUI Agent 从人工标注走向真实 App 自适应
从 GUIAgent 专家视角解析 MobileForge:用 MobileGym 与 HiFPO 把真实移动 App 探索、自动任务生成、层级反馈和 GRPO 训练连成 annotation-free adaptation 闭环,并讨论它对 APP 自动化测试与移动端 QA 的价值和风险。
AndroidDaily:闭源真实 App 上,Mobile GUI Agent 终于开始被“过程可验证”地评测
从 GUIAgent / computer-use agent 专家视角解析 AndroidDaily:350 个真实闭源 Android App 任务、94 个高频应用与 GRADE 过程感知评测,把移动端 GUI Agent 评测从静态 grounding 和开源沙箱推向真实 App 自动化与可诊断验证。
MementoGUI:长程 GUI Agent 的瓶颈,正在从视觉定位转向多模态记忆控制
从 GUIAgent / computer-use agent 专家视角解析 MementoGUI:它把长程 GUI 控制从 raw history replay 和 text-only memory 推向可学习的多模态工作记忆与情景记忆控制,但其 offline benchmark、VLM judge 与低轨迹成功率也提示工程落地仍需谨慎。
SaaS-Bench:GUI Agent 从“会点网页”到“能完成真实 SaaS 工作流”还差多远?
从 GUIAgent / computer-use agent 专家视角解析 SaaS-Bench:23 个真实可部署 SaaS、106 个专业工作流、长程多应用任务和可验证 checkpoint 如何暴露当前 CUA 在规划、状态追踪、自验证与工程落地上的短板。
CUA:GUIAgents 运行时与电脑使用闭环
基于 trycua/cua 源码,解析 CUA 的项目分层和 GUIAgents 运行时:ComputerAgent 如何选择模型 loop、统一工具协议、执行电脑动作、回灌截图,并兼容 OpenAI、Claude、UI-TARS、OmniParser 和组合 grounding 模型。
近一年 GUIAgent 论文综述:从会点屏幕到可验证的移动端 QA Agent
系统梳理 2025-06-15 至 2026-06-15 公开可检索的 GUIAgent / computer-use agent 论文,从移动端 APP 自动化测试、benchmark、grounding、RL、自进化、verifier、混合工具与安全治理七条主线总结领域变化。
LivingScreen:GUI Agent 不能再假装屏幕是静止的
解析 arXiv 2026 论文 Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms。文章从 GUIAgent 专家视角评估 LivingScreen 对动态屏幕、观察控制、短视频原生界面和 APP 自动化测试的启发。
WindowsWorld:GUI Agent 终于被放进跨应用办公流里考试
解析 arXiv 2026 论文 WindowsWorld:一个面向 Windows 专业跨应用工作流的 process-centric GUI Agent benchmark。文章从 GUIAgent 专家视角评估它相对 OSWorld、AndroidWorld、VisualWebArena、MacArena 的位置、可信度、局限,以及对 APP 自动化测试和移动端 QA 的启发。
MacArena:终于把 GUI Agent 拉到真实 macOS 竞技场里
解析 arXiv 2026 论文 MacArena:一个运行在 Apple Silicon 虚拟化环境上的 macOS computer-use agent 在线基准。文章从 GUIAgent 专家视角讨论它相对 OSWorld、macOSWorld、AndroidWorld、VisualWebArena 的位置、可信度、局限,以及对 APP 自动化测试和移动端 QA 的启发。
HiViG:GUI Agent 的 critic 不该只打分,还要看坐标和记住历史
解析 arXiv 2026 论文 A History-Aware Visually Grounded Critic for Computer Use Agents:它如何用宏动作历史与视觉落点校验提升 web、mobile、desktop computer-use agent 的测试时可靠性。
Orchard:开源 GUI Agent 训练不缺 Harness,缺的是可扩展的环境层
解析 arXiv 2026 论文 Orchard:一个面向 SWE、GUI/browser navigation 和个人助理任务的开源 agentic modeling 框架,以及它对 GUI agent 训练基础设施的启发。
DeskCraft:桌面 GUI Agent 离真实专业工作流还有多远?
解析 arXiv 2026 论文 DeskCraft:一个覆盖 538 个专业桌面任务、长程工作流和人机协作协议的执行式 GUI Agent 基准。
Loop Engineering:把提示词变成可验证的自治回路
全网搜索 Loop Engineering 之后,我对这个概念的理解:它不是替代 prompt engineering,而是把触发、上下文、工具、验证、状态和停止条件工程化,让 AI Agent 可以在边界内持续推进任务。
QA Wolf:把端到端测试做成 AI 平台 + 托管服务
从官方文档和官网页面拆解 QA Wolf 的完整服务链路:环境准备、Mapping、Automation AI、调试、运行、失败调查、清理发布和 Full Service 到底分别做什么。
StainFlow:给 GUI Agent 的每一步进展一条可追踪证据链
解析 arXiv 2026 论文 StainFlow:如何用实体染色流和自适应证据窗口,为长程 GUI Agent 强化学习提供更可靠的过程奖励。
近两个月 GUI Agent 论文全景:从“会点击”走向可训练、可验证、可部署的 Computer Use 系统
梳理 2026-04-08 至 2026-06-08 期间可检索到的 90+ 篇 GUI Agent / Computer-Use Agent 相关论文,总结基准环境、GUI grounding、RL 训练、长程记忆、工具融合、安全可靠性等研究趋势。
Open Code Review:把 AI 代码审查拆成确定性流水线
拆解 alibaba/open-code-review:它不是简单把 diff 丢给模型,而是用文件筛选、规则匹配、并发子任务、专用工具、评论定位和会话记录,把 Agent 约束进一条可观测的审查流水线。
OpenOmniBot:把 Android 手机做成端侧 Agent 运行时
拆解 omnimind-ai/OpenOmniBot:它不是普通 AI 聊天 App,而是把 Android 无障碍、VLM、MCP、Alpine 工作区、Skill、记忆和 OmniFlow Function 接到同一个端侧 Agent 闭环里。
SE-GA:让 GUI Agent 从静态执行器进化成会积累经验的学习者
解析 ICML 2026 论文 SE-GA:如何用 TTME 分层记忆与 MASE 自进化训练,提升图形界面智能体在长程、多步、动态 GUI 任务中的泛化与稳定性。
Video2GUI:把互联网教程视频变成 GUI Agent 的预训练燃料
解析 ICML 2026 论文 Video2GUI:如何从 5 亿级视频元数据中自动筛选教程视频,构建 WildGUI 大规模交互轨迹数据集,并用它提升 GUI grounding 与 computer-use agent 泛化能力。
全栈工程师应该怎么做架构设计
从业务目标、质量属性、前端体验、后端领域、接口契约、数据一致性到可观测性,整理一套可落地的全栈架构设计方法。
GUI-CIDER:GUI Agent 需要的不是更多轨迹,而是可内化的界面世界知识
解析 arXiv 2026 论文 GUI-CIDER:如何用因果内化与密度感知样本重选,在 mid-training 阶段把 GUI 轨迹转化为可迁移的界面世界知识。
Flue:把 Claude Code 式 agent 变成可部署的 TypeScript 框架
拆解 withastro/flue:它不是一个聊天 SDK,而是围绕 harness、session、sandbox、skills、routing 和 build target 设计的 headless agent 框架。
UI-Voyager:让移动 GUI 智能体从失败轨迹里自我进化
解析 UI-Voyager 如何用 RFT 与 GRSD 把稀疏的任务成败反馈转化为可学习的步骤级监督,并在 AndroidWorld 上让 4B 模型达到 81.0% Pass@1。
VeriGUI:GUI Agent 不该盲目行动,而要先确认动作真的生效
解析 ACL 2026 论文 Don’t Act Blindly:为什么 GUI Agent 容易在失败动作上死循环,以及 VeriGUI 如何用 TVAE、Robust SFT 和 GRPO 建立动作结果验证与自纠错能力。
Hermes Agent 自动沉淀 Skill:从后台复盘到 Curator
结合源码、prompt 和示意图,拆解 Hermes Agent 如何在复杂任务后复盘、写入 Skill、标记来源,并由 Curator 做二次整理。
ASSERT:把需求文档变成 AI Agent 回归测试
从 ASSERT 的 spec-driven 评测思路、四段流水线、本地 artifact、Trace 证据链和 Viewer,看它如何把自然语言需求变成可复跑的 AI 系统评测。
基于 OpenClaw 项目的 AI Agent 技术分享
从 OpenClaw 的 Gateway、工具体系、Skills、MCP 与 Agent 执行流程,看个人 AI 助手系统的工程架构。
GUIAgent在测试领域的产品形态思考
GUIAgent在测试领域的产品形态思考
AUITestAgent-一句话让AI帮你做UI测试
前端UI测试Agent
4 - 浩瀚苍穹
第4期 - 浩瀚苍穹
3 - 周公除三害
第3期 - 周公除三害
2 - 杯中养鱼
第2期 - 杯中养鱼
1 - 鸭绿江断桥
第1期 - 鸭绿江断桥
Mobile-Agent解析
Mobile-Agent解析
AppAgent笔记
基于多模态大模型的APP操作Agent
YoloV7学习与使用
YoloV7学习与使用
LangChain Models+Prompts
LangChain学习
Frida Hook工具
Frida hook工具简单总结
QTypist论文笔记
QTypist论文笔记
Windows Terminal
WT
AGSS-VOS: Attention Guided Single-Shot Video Object Segmentation 论文解读
VOS
VisDrone2019记录
LeetCode
Pytorch Tensorboard
Pytorch
DANet-CCNet
LeetCode
Context Encoding for Semantic Segmentation
LeetCode
没有匹配的文章。