Codex Harness 分析相关 agent harness 和 runtime,后续需要深入了解 OpenCode 分析 multi agent 以及可拓展性。
一、启动架构
终端执行 codex 之后,Codex CLI 的总入口在 codex-rs/cli/src/main.rs,其中通过 run_interactive_tui 启动 codex_tui::run_main -> startup_orchestration::run_main_inner()
Codex Harness 分析相关 agent harness 和 runtime,后续需要深入了解 OpenCode 分析 multi agent 以及可拓展性。
终端执行 codex 之后,Codex CLI 的总入口在 codex-rs/cli/src/main.rs,其中通过 run_interactive_tui 启动 codex_tui::run_main -> startup_orchestration::run_main_inner()
它本质上是在原有的 Codex Thread / Session / Agent Loop 之上,加了一层 Agent orchestration / control plane ,让一个 Agent 可以创建和控制其他独立的 Codex Thread。
从 Parent Agent 看,Subagent 首先表现为一个 Tool
Codex 给模型暴露了 multi-agent tools,例如当前代码中的:
spawn_agentsend_input / V2 的 send_messagewait_agentlist_agentsclose_agentresume_agent如果把人类暂时比作一个 LLM,那么成长过程中的语言输入、视觉经验、社会互动和现实反馈,就类似于模型的预训练数据。人在成长中不断听到、看到、经历各种事件,类似 LLM 预训练。这一过程可以近似理解为一种广义的 distribution matching:人脑通过经验建立对世界的预测模型。
在这个类比中,LLM 的上下文长度可以对应为人类在时间中的连续意识流。模型在上下文窗口中不断预测下一个 token,而人在现实时间中不断生成念头、判断、语言和行动。当一个人没有明确目的时,脑中浮现的内容就像是在当前状态下进行采样,就好比预训练 LLM 直接用于推理。
术语:
如果使用第三方 API,需要在终端配置好 API 环境变量后,在 IDE 或者终端中开启 claude。
如果使用 claude 订阅,终端使用 /login 登录账号
终端运行:claude,使用 /resume 可以继续某个 session。
| Command | What it does | Example |
|---|---|---|
claude |
Start interactive mode | claude |
claude "task" |
Run a one-time task | claude "fix the build error" |
claude -p "query" |
Run one-off query, then exit | claude -p "explain this function" |
claude -c |
Continue most recent conversation in current directory | claude -c |
claude -r |
Resume a previous conversation | claude -r |
/clear |
Clear conversation history | /clear |
/help |
Show available commands | /help |
exit or Ctrl+D |
Exit Claude Code | exit |
| 来源 | 场景 / 配置 | 权重格式 / 优化 | 显存结论 | 时间结论 |
|---|---|---|---|---|
| LTX 官方博客 | 本地运行 LTX-2.3 22B | bf16 full local inference;低显存用 GGUF / FP8 | bf16 full local 至少 32GB VRAM ;Pro mode 更适合 A100/H100 | 未给明确单次耗时 |
| HF 官方模型文件 | ltx-2.3-22b-dev.safetensors |
bf16 / 原始权重 | 文件约 46.1GB ;理论加载主模型权重约 44–46GB | 不涉及推理时间 |
| WaveSpeed ComfyUI 博客 | ComfyUI 两阶段 pipeline | FP8 或 GGUF Q4;半分辨率 Stage 1;VAE offload | 12GB 可尝试低配单图/短视频; 16GB 更顺; 24GB 更适合 PyTorch 路线 | 未给稳定统一时间 |
| Digital Applied 技术博客 | RTX 4090,1080p,10 秒,50 steps | 未完全等同官方 benchmark | RTX 4090 级别,通常需要优化/量化/offload | 约 3–4 分钟 |
| Digital Applied 技术博客 | RTX 5090,4K,10 秒 | 高分辨率推理 | 4K 推理通常需要大显存和优化 pipeline | 约 8–12 分钟 |
| Zen Van Riel 工程博客 | RTX 3080 10GB,960×544,带音频短片段 | GGUF Q4_K_S | 10GB VRAM 可跑低分辨率 | 约 2–3 分钟 |
| Zen Van Riel 工程博客 | 1080p 本地生成 | 建议 GGUF / 量化 | 建议 16GB+ 更适合舒适 1080p | 未给统一时间 |
| Unsloth HF 讨论区 | RTX 5080 16GB | GGUF Q4_K_M | 用户反馈 16GB VRAM 可顺畅运行 | 未给标准耗时 |
| 理论估算 | bf16 原始 22B 主模型 | 22B × 2 bytes | 仅主模型权重约 44GB ;完整 pipeline 峰值通常更高 | 不涉及 |
| 理论估算 | FP8 / INT8 22B | 约 1 byte/param + scale/metadata | 主模型约 22–30GB | 比 bf16 省显存,速度取决于 kernel |
| 理论估算 | GGUF Q4 | 4-bit 量化 | 主模型约 13–17GB | 速度可能受实现影响 |
对熵,编码长度,MDL,压缩,柯氏压缩器的回忆梳理。
本节观点
熵就是一个随机变量能够被压缩到的“平均最短编码长度”的理论极限。
如果模型的平均编码长度越短,那么他和数据的真实分布(真实熵)就越接近。因为根据 cross-entropy(交叉熵) ,它和真实熵关系是:
H(p,q)=H(p)+KL(p∥q)
对部分 test-time compute / inference-time learning / reasoning models 的记录。
在 openai 官方发布中提到:
这里发现,随着强化学习(训练时间计算)和思考时间(测试时间计算)的增加,o1 的性能也在不断提高。这种方法的扩展限制与 LLM 预训练的限制有很大不同,这里正在继续研究。
671B-A37B 模型,基于 DeepSeek-V3 架构继续训练和后训练得到的 hybrid model:同一个模型可以通过 chat template 切换 “thinking mode” 和 “non-thinking mode”。
thinking efficiency 更高,long-context extension 更强