边界存在于“记忆与习惯”里
- 全局索引和旧 Advisor 容易把别的项目规则带进来。
- 主模型负责计划、执行、解释和自我验收。
- 同一 macOS 用户下,凭据和运行时距离模型进程太近。
- 并行写入、重试和长会话容易互相放大问题。
- 没有清晰 baseline 时,很难证明回滚只回滚本任务。
DSH · MEMORY · ADVISOR · SECURITY
这轮不是简单地“换了个更聪明的模型”,而是给鹿崽系统补上了房间边界、门卫、副驾驶、安全柜、施工锁和可回退路标。
最重要的变化:以前很多边界靠模型“记得遵守”;现在尽量变成模型之外、能测试、能拒绝、能审计的系统规则。
规则容易串,错误也容易被自己证明成“没问题”。
这轮最值钱的不是多了多少功能,而是把项目归属、记忆适用范围、审查、写入权和凭据处理从提示词愿望,往确定性规则迁了一大步。
以前像所有项目共用一块白板、一串钥匙,做事的人还要自己给自己打分。
所以“相关”很容易被误当成“适用”:眼镜会话可能看到 MaiBot 的发图限制;主模型说“完成了”,也可能没有另一双眼睛及时追问证据。
一句最诚实的话:现在比以前稳很多,但不是“全部问题彻底消失”。尤其是生产 broker、独立 OS 身份、MiniMax / Alibaba 外部失效和完整 fresh-worker AgentLoop,仍明确留在待办区。
老大的判断是对的:系统维护和项目总控确实需要跨项目视野;但普通业务项目不能因此自动继承另一个项目的规则。现在这两件事被分开建模。
能看项目目录,不等于把所有房间的规则都塞进当前会话。
把系统/总控想成大楼管理员:它需要知道有哪些房间、谁负责、哪里报警,所以有跨项目“目录和协调视野”;但它不会把 201 室的操作守则自动贴进 305 室,更不能因为能看目录就随便搬别人的东西。
owner_global鹿崽身份、老大的稳定偏好、跨入口连续性。
全局适用runtime_globalDSH / Codex / Hermes 的安全和调度规则。
全局适用portfolio_global只自动给系统维护与项目总控,用于项目登记、路由和协调。
限主控角色capability:luzai-image-output通用“怎么发图”的范式,能力确实存在时才启用。
按能力启用connector:maibot-mediaMaiBot 特有上传/媒体限制;仅 MaiBot connector 活跃时适用。
不进眼镜project:<id>某一个项目的事实、规则和证据,默认只在该项目房间里。
严格隔离旧全局启动链和旧 Advisor 能先看到 MaiBot / Android 媒体边界。即使当前 cwd 是眼镜,“相关词”也可能把不适用规则带进判断。
会话先绑定眼镜项目;真实 fresh smoke 中 connector_ids=[],scoped prompt 没有注入 MaiBot 媒体边界,Guard 也会服务端重算权限。
它把“这个 session 属于哪个项目”做成首绑不可变:根据已登记项目根目录和当前 cwd 做最长匹配,得到确定性 revision;同一个 owner / peer / session 若中途改报项目、scope 或 revision,Guard 返回冲突。普通项目跨项目 mutation 默认拒绝,未绑定 session 对写操作 fail closed。
还没有完整实现“发现目标项目变化 → 自动收束旧 session → 新建项目 session → 生成最小 handoff”。真实 MaiBot 对照,以及“发图 / root Android / 显式跨项目比较”等用户语义回归也仍待补。
老大要的不是主模型干完以后再找人盖章,而是副模型在执行过程中持续看它有没有偏离目标、跨错项目、无证据宣布完成,必要时能把它叫回来。
同一段历史会放大沉没成本,跑偏后更难主动推翻自己。
真人目标 revision 更新后,旧 verdict 会自动 stale-drop,不把过期建议重新注入。
旧 Advisor 缺少严格项目作用域,也没有清楚的“证据序号、目标 revision、binding revision”。它可能把别项目规则当建议,又很难判断建议是不是已经过时。
同一 session 只允许一个审查在飞;后续 checkpoint 用 latest-wins 合并,不积压旧建议。下一次只读从 lastReviewedSeq 开始的有界新证据,并绑定当前项目和目标。
completion_without_evidence。这正是老大要的“持续纠错”:不是等最终报告才点评,而是发现主模型已经停下但结论站不住时,还能主动叫它回来修正。
ReviewFrame 会排除 system prompt 和 workspace/plugin prompt 注入,只带当前 binding、当前目标、限定 event seq、错误摘要和预算;结构化字段和文本都做敏感数据门。未知字段、错误 scope 或证据序号会 fail closed。
不等于。Advisor 是在线副驾驶,负责及时发现偏航;完整 AgentLoop 还需要每轮 fresh worker、独立 cycle critic、严格终态、持久任务状态、下一动作和 host restart 恢复。当前这部分仍未实现。
fast same-turn inject、第二次 unresolved concern 升级 owner-visible blocker、blocker / goal pause / steer / tool-gate 已有确定性回归,但尚未全部做受控生产 E2E;长期误报率和延迟也需要继续观察。
这里最容易被一句“已经安全了”说过头。现在确实补了很多门,但生产 Guard 仍是 legacy,Swift broker 仍是 mock-only canary,same-UID 的最终隔离还没有完成。
同一 macOS UID 下,shell/code 能力仍可能形成旁路。
两个 P0 仍开放:旧 MiniMax 值仍在 9 份私密历史归档中作为事故证据存在,必须在 provider 侧确认旧 key 失效;Alibaba 登录 cookie 也需要服务端 logout-all / session 失效确认。本机删除和脱敏不能替代服务端吊销。
legacy;当前断言 replay cache 只适合严格单实例。不能。它覆盖正常工具/API 路径里的可识别标签与结构,并对 getter、proxy、未知结构等 fail closed;任意无标签 opaque 字符串、加密/压缩内容、媒体内容和 same-UID 直读仍不属于完整 DLP 保证。它是有效的纵深防御,不是最终 sandbox。
串项目只是表象之一。审计还发现并行写入覆盖、JSONL 缺口、重试风暴、长会话无 goal、市场插件来源漂移等问题。这轮给这些路径加了明确护栏。
成员、captain 和主线程可能基于不同旧版本修改重叠文件,出现 stale edit、覆盖或“测试的版本不是最终版本”。
精确根集合原子 acquire/release;祖先/后代冲突,主线程和 captain 也要服从。跨进程锁对损坏 owner fail closed。
认证失败、内容拒绝、上下文错误和网络抖动可能混用一套重试逻辑;XAI 历史出现过大量 retry-started。
provider + model + code + 归一化 message 组成指纹;认证、凭证、quota、invalid request、context window 等直接停并诊断。
“装得上”不代表来源固定、权限合理、许可证清楚,也不代表插件规则会尊重当前项目。
安装前检查 exact provenance、完整 Git SHA、权限扩张、quarantine 和 literal secret;市场 mutation 已禁用,desired/live 都是 11 个直接依赖。
| 护栏 | 现在能做什么 | 还缺什么 | 状态 |
|---|---|---|---|
| Workspace lease | 阻止 AgentTeams 重叠路径并发写;主线程不能旁路。 | 真实生产冲突 E2E、read/version token 与 tree hash。 | 已运行 / 待补 E2E |
| Session integrity | 新健康 session 对 seq、call/result 配对、step/turn pending fail hard。 | 旧 40 条坏物理行、缺 seq 4244/23555 和 writer 根因没有修复。 | 预防已上线 |
| Harness guard | 未知工具不当只读;跨项目 mutation、敏感取值命令和危险结果结构 fail closed。 | bounded search、统一结构化 tool outcome、read-before-edit CAS。 | 生产运行 |
| Plugin supply chain | 市场写入口禁用;候选插件按来源、权限、quarantine 验证。 | 7 条低风险 engine/license 元数据、全部第三方源码逐行 review。 | 生产运行 |
| Goal / AgentLoop | Ralph 从 64 收紧到 8;Advisor completion certificate 有确定性测试。 | fresh worker、independent critic、持久 continuation 与 restart 恢复。 | 仍未完整实现 |
路径租约像施工许可证:A 队正在拆 3 楼承重墙,B 队就不能同时进去改同一堵墙。可是“只有一队施工”仍不等于它手里的图纸是最新版本,所以 read/version token 还是下一道要补的门。
因为本轮根因是作用域、审查、凭据和执行合同,不是缺 Cloudflare、Drive、Calendar 或任务管理能力。无目标安装只会扩大 credential、网络与跨项目数据面。现在的策略是“任务确实需要才按最小权限接入”,不是用安装数量证明系统变强。
以前既有新的 Guard/OpenViking 权威,又残留旧 Core native sync 可执行路径;同时源码仓缺少稳定 baseline。现在“哪条路能写、出事回哪里”清楚了很多。
被划掉的是 native-sync artifact set;不能因此把另一套 Core write CLI 写成“已经关闭”。
旧 native sync 仍能被人工或模型误调用,重新建立第二套记忆写入路径。没有清晰 baseline 时,也难证明某次提交有没有带进用户旧改动。
workspace source/test 与系统 runtime 三份旧 native-sync artifact 已改为 .txt、0444 并记录路径、mode、大小与 SHA-256;三个源码仓建立本地 baseline。
没夹带用户改动:workspace 当时有大量既有/旁支脏改动;本轮使用精确 staged 路径,报告提交后暂存区为 0。DSH、memory-platform 无 remote,OpenViking 只保留原有上游 remote;本轮没有新增 remote,也没有 push。
有一个单独开放问题:活动的 workspace/tools/luzai_core.py 仍注册 append-batch、claim-add、claim-revise、claim-import 等写命令。它不是被隔离的 native-sync artifact set,审计仍明确 WARN;需要先盘点仍要保留的只读维护能力,再单独迁移或加不可绕过的 read-only gate。
不等于。Git 只是可靠“路标”和差异权威。完整续跑还需要持久 task state、当前 goal revision、下一动作、证据索引、严格 verdict 和 host restart 后的恢复合同;这些仍待实现。
看这张表就能避免口径混乱。“有源码”“测试通过”“运行中”“真实业务 E2E”是四个不同层级,不能互相代替。
| 能力 | 改后现状 | 你可以相信到哪一步 | 状态 |
|---|---|---|---|
| 项目 binding | 首绑不可变;Guard 服务端重算 scope;普通项目跨项目 mutation fail closed。 | 系统与眼镜 fresh smoke 通过;眼镜没有 MaiBot connector 注入。 | 已生产 |
| 记忆读写边界 | 同一 Guard/OpenViking 在线权威;completed owner turn 才进入 guarded extraction。 | 正常 bound ingress/recall 已接线;历史旧内容不因此自动清洗。 | 已生产 |
| Advisor supervisor | active;step/end checkpoint;latest-wins;terminal concern follow-up。 | 真实“无证据完成 → 撤回 → 再审 OK”闭环通过;部分 blocker 分支仍只到测试。 | 主动运行 |
| Secret / descriptor gate | DSH、Guard、模型输入输出和读 egress 多层可识别敏感数据门。 | 运行态合成探针通过;不覆盖任意 opaque / 加密 / 媒体与 same-UID 直读。 | 已生产 |
| AgentTeams lease | write_roots 原子租约,主线程/captain 同锁。 | 17/17 回归;真实生产冲突 acquire→deny→release→reacquire 待补。 | 已生产 / E2E 待补 |
| Session integrity | 新健康 session 的 seq、call/result 和 pending 合同 fail hard。 | 防新增损坏;不修复旧 40 条坏物理行,也未定位 writer 根因。 | 预防已上线 |
| Plugin supply chain | policy/lock 分离、市场 mutation 禁用、candidate quarantine。 | blocking 0;仍有 7 条低风险元数据和第三方源码 review 待办。 | 已生产 |
| Native sync | 三份 runnable artifact 撤下并只读哈希封存。 | 该 artifact set 已关闭;旧 luzai_core.py 写 CLI 是另一项开放问题。 | 已隔离 |
| MiniMax 轮换器 | stdin-only、值盲输出、锁、原子替换、回滚、可同步 DSH。 | 工具 20/20;provider 旧 key 尚未确认失效。 | 工具完成 / 外部待办 |
| Guard / Swift broker | LBA1、短 TTL/JTI、角色分权、peer 与 macOS ACL 安全测试。 | Python 204/204、Swift 21/21;生产 Guard 仍 legacy,broker 未安装。 | source-only canary |
| 完整 AgentLoop | 已有 Advisor、Ralph 上限和 Git baseline 作为地基。 | fresh worker/critic、严格持久状态、restart 恢复尚未实现。 | 未完成 |
| Alibaba session | GUI launchd 已清除 cookie;loader fail closed。 | 服务端 logout-all / session 失效尚未确认。 | 外部待办 |
很多安全改造平时应该“没感觉”;真正出问题时,它们才会表现为更少串线、更早停手、更明确说降级、更容易回到正确版本。
在眼镜项目问发图,不应再莫名背出 MaiBot 的媒体限制;系统/总控仍保留跨项目协调视野。
Advisor 会追当前目标和证据;真实样本里,主模型已被叫回来撤回一次无证据完成。
认证、quota、invalid request 等永久错误不会再当网络抖动无限重试;同指纹瞬态错误也有硬上限。
AgentTeams 成员必须先拿路径租约;主线程和 captain 也不能趁成员工作时绕过去改同一棵路径。
Recall 失败会产生固定、简短的 degraded 标记,而不是悄悄装作记得或把异常正文塞回上下文。
源码仓已有本地 checkpoint 和精确 staged 证据;回滚不会默认吞进 workspace 的旧改动,也不会自动 push。
还不会自动做到:抹掉旧会话里的事故证据、让任意秘密永不泄漏、自动吊销 provider key、把跨项目 mutation 变成合法 handoff、在 host 重启后保证任务自动续跑,或让所有 Advisor / AgentTeams 风险分支都天然拥有生产 E2E。
接下来不是继续堆功能,而是先把两个外部 P0 真正失效,再把 source-only broker 补齐生产条件,最后完成 AgentLoop 和剩余真实回归。
这些数字证明受检代码通过相应测试,不自动扩大为“所有生产边界都完成”。
本地提交:
workspace 的大量既有/旁支脏改动未夹带;本轮未新增 remote,未 push。