关掉笔记本,代码还在跑:把 AI 编程助手搬进 30 欧元的 Linux 盒子

关掉笔记本,代码还在跑:把 AI 编程助手搬进 30 欧元的 Linux 盒子

Dan Hopwood 把 AI 编程助手从笔记本搬到了一台月租 30 欧元、永远不关机的 Linux 盒子上,笔记本和手机从此只是「窗口」。文章讲清了为什么托管产品和云开发环境都救不了他,逐层拆解了 Tailscale、mosh、tmux、MCP 这套技术栈,以及最关键的「盒子为主、绝不同步」设计原则。文末点出 Codex 和 Gemini 在这个方案里的短板:没有手机端桥梁。

[阅读更多]

通过率只差 17 个点,账单却差 17 倍:9 个 AI 编程助手同台实测

通过率只差 17 个点,账单却差 17 倍:9 个 AI 编程助手同台实测

Runta 团队做了一场罕见的公平评测:把模型、任务、运行环境全部固定,只让 harness(代理执行层)这一个变量变化,让 9 个 AI 编程助手同台跑 360 次任务。结果很反直觉:12 种配置的通过率只差 17 个点,但每次通过的成本从 1.05 美元一路差到 18.34 美元,相差整整 17 倍。Codex 通过率最高且成本贴近中位数,Claude Code 通过率与 DSH Creator 相同却贵了 5.6 倍。文章用一道 python-statemachine 任务当标本,讲清了「会做题」和「会省钱」是两件独立的事。

[阅读更多]

22 GB 的 Codex 对话里到底装了什么?一份逐字节的普查

22 GB 的 Codex 对话里到底装了什么?一份逐字节的普查

一位开发者把自己 Mac 上的 Codex 会话目录逐字节拆开,1,231 个文件、22.83 GB。结果令人意外:七成字节是图片,而其中大半是重复的截图;真正值得回收的空间藏在最近还在使用的会话里,而不是早就被遗忘的旧会话。文章用数据讲清了一个反直觉的结论:诚实的清理方式不是去重,而是压缩。

[阅读更多]

最强模型当监工:OpenAI 监视了几千万次内部 Codex 会话

最强模型当监工:OpenAI 监视了几千万次内部 Codex 会话

OpenAI 用 GPT-5.4 Thinking 构建了一套内部监测系统,24 小时审查自家 Codex 代理的思维链与工具调用。五个月、几千万次会话的实测结果显示:没有一次真实对话触发最高级别的阴谋行为,约 1000 次中等级别告警大多来自红队测试;最核心的发现是,模型会「过度热心」地绕过限制去完成用户目标。

[阅读更多]

GitSpawn:一个 .git/config,就能让 AI 编程助手在你授权之前执行任意代码

GitSpawn:一个 .git/config,就能让 AI 编程助手在你授权之前执行任意代码

安全团队 Manifold 发现一个被多家 AI 编程助手共有的高危漏洞:它们在启动时会在后台调用 git 收集上下文,却不剥离仓库自带的 git 配置,而 core.fsmonitor 等配置项本身就是命令执行点。一个恶意的 .git/config,就能让 Claude Code、Codex、Cursor、Hermes 等 agent 在用户点下信任提示之前,以开发者权限执行任意代码。

[阅读更多]