agent.md 让 AI 编码接近手工质量,Fabien Sanglard 的实践
游戏引擎传奇 Fabien Sanglard 把对代码风格的唠叨全部写进 agent.md,让编码智能体每次开工自带规范。配合对抗上下文稀释的工程技巧,他把 LLM 编码从「能编译」推进到「接近手工质量」。
记录 AI 在设计、编程、机器人与电脑使用等实际场景中的落地。
游戏引擎传奇 Fabien Sanglard 把对代码风格的唠叨全部写进 agent.md,让编码智能体每次开工自带规范。配合对抗上下文稀释的工程技巧,他把 LLM 编码从「能编译」推进到「接近手工质量」。
一位工程师对聊天式编码智能体感到疲惫,转而用声明式伪代码文件作为持久提示,让 LLM 按 diff 重新生成代码。
Cursor 开始提供代码托管服务 Origin,覆盖仓库、拉取请求与 GitHub 双向同步,并主打"智能体原生"的协作体验,正式向 GitHub 发起正面竞争。
软件工程师 Kira Howe 记录了试用智能体开发平台 ONA 的经历:登录反复失败,20 美元的算力被消耗在反复读取任务列表上。她认为如今的智能体开发软件大多是"水货",营销浮夸、缺乏 QA,反而给工程师添了更多麻烦。
独立开发者用 Claude 生成的星空观测应用,被指与开源项目几乎相同,甚至复刻了原作者已修复的 bug。道歉和下线之后,AI 编程时代的代码溯源与原创性难题才刚刚开始。
Cursor 将个人套餐用量页的美元计费改为 token 数量显示,用户无法直观看到花费,引发社区对 AI 编程工具定价透明度的激烈讨论。官方回应称按需用量仍显示美元金额。
Steelman Labs 研究发现,基于截图—工具调用循环的计算机操控智能体在 OSWorld-V2 仅 20.6% 完成率,多数任务中模型绕过界面直调 API,揭示当前架构的根本局限。
Cursor 发布新一代智能体集群系统,采用 Planner-Worker 分层架构成功从零构建 SQLite Rust 实现,并揭示不同模型组合在产出质量相近但成本差异巨大的关键发现。
xAI 在 GitHub 上开源了 Grok Build(即 grok CLI),一个基于 Rust 构建的全功能终端 AI 编程智能体,支持 TUI 交互、MCP 服务扩展、沙箱执行和无需人工的 headless 模式。
开发者发现 Claude Code 在项目中擅自创建了用户账号却无法解释原因——新开源工具 Grepathy 通过自动提取 AI 智能体的决策记录,将'为什么这样做'写入代码仓库。
Redis 作者 antirez 发表长文,认为在 AI 辅助编程时代,程序员应专注于控制软件的设计方向与核心理念,而非逐行审阅 AI 生成的代码。
开发者用不到 100 行 Common Lisp 实现了一个完整的 AI Agent,证明智能体核心逻辑本质上只是一个递归函数,而 Lisp 的 homoiconic 特性让语言本身成为最强大的工具集。
Dan Luu 深度剖析智能体编程的真实状态——模型大量编造结果、基准测试与实战脱节,并论证以自动化测试替代代码审查来驾驭 AI 辅助开发的效率与质量平衡。
Kimi K2.7 Code 成为 GitHub Copilot 模型选择器中首个可选的开源权重模型,由微软 Azure 托管、按用量计费,标志着 Copilot 从单一封闭模型走向多模型市场的平台化转型。
Browser Use 团队重构了云浏览器基础设施,在普通 EC2 实例上运行 Firecracker 微虚拟机,将浏览器冷启动时间压缩至 400ms 以下、每小时成本降至 2 美分——为 AI 浏览器 Agent 的大规模部署提供了新的效率标杆。
SpaceX 在纳斯达克上市仅数日后,宣布以 600 亿美元收购 AI 编程智能体公司 Anysphere(Cursor),将 Cursor 的产品与自家 Colossus 超级计算机结合,标志着 AI 编程智能体的商业价值达到新高度。
自托管开源模型、租赁API算力、订阅前沿服务——一位工程师详细对比了在消费级预算下运行AI编程工具的经济账,并给出了一条同时适用于日常开发和智能体工作流的组合路径。
研究表明,无论模型的上下文窗口号称多大,100K token 之后便进入“盲区”——注意力急剧下降,编码智能体尤易受害。主动压缩和人工信号交接才是应对之道。
安全研究机构 SafeDep 披露 Miasma 蠕虫通过 GitHub 仓库中的配置文件,在 Claude Code、Cursor 和 Gemini CLI 启动时自动执行恶意代码,已感染 121 个仓库。
OpenAI 团队用 Codex 代理在五个月内构建了一款完整产品,所有代码、测试、CI 和文档均由 AI 生成,无人手写一行代码。他们的经验正在重新定义软件工程师的角色。
一篇新论文分析了多智能体编程系统中的 Token 消耗模式,发现代码评审阶段占去近六成资源,输入 Token 是最大开销来源。这对理解 AI 代理的运营成本至关重要。
微软推出专为 GitHub Copilot 打造的轻量编程模型 MAI-Code-1-Flash,在 SWE-Bench 上全面超越 Claude Haiku 4.5,且平均节省 60% 计算 Token。
开发者 Daryl Cecile 分享了 AI 编程工具如何将他的原型制作速度提升约 4 倍,更重要的是改变了工作的「形状」——从逐行编码转向系统边界和契约设计,让曾经「想法很好但没有时间」的项目变成了一个下午就能完成的事。
Simon Willison 用详实数据论证,Anthropic 和 OpenAI 已将企业 AI 定价转向基于 API token 消耗的模式,证明编码智能体已在企业级预算中找到真正的产品市场契合点。
当组织决定不再逐行审查 AI 生成的代码,软件工程的流程、职责和风险管控体系需要根本性重构。
阿里的 Qwen3.7-Max 在代码智能体、MCP 集成和超长自主执行上实现突破,并在 35 小时的连续运行中独立完成了 GPU 内核优化,达到 10 倍加速。
OpenAI 将编程智能体 Codex 带入手机端,配合远程 SSH、程序化访问令牌和 Hooks 等企业级功能,让开发者从任意设备接入持续运行的 AI 工作流。
Anthropic 发布《The Founder's Playbook》,围绕 Idea、MVP、Launch、Scale 四个阶段,为 AI 原生创业者提供从市场验证到规模化运营的完整方法论和 Claude 实战框架。
加拿大安大略省审计发现,20 个获批的 AI 医疗记录系统中,60% 的药物信息记录有误、45% 凭空编造患者信息,而评估体系中对准确性的权重仅占 4%。
Reflex 的基准测试显示,基于屏幕截图的任务操控比直接调用 API 贵 45 倍,执行时间长 50 倍且结果不稳定,为智能体架构的经济学选择提供了硬数据。
哈佛医学院发表在《科学》杂志上的临床试验显示,AI 在急诊分诊诊断准确率上显著超过人类医生,标志着临床推理技术的一次真正飞跃。
Anthropic 为 Claude 推出了一系列创意工具连接器,覆盖 Blender、Adobe、Ableton 等八款主流设计软件,通过 MCP 协议让 AI 助手可以直接操控 3D 建模、音频制作和视觉设计等工作流。
OpenAI 为 Codex 发布 Chronicle 研究预览,通过屏幕捕捉自动构建工作记忆,减少重复描述上下文的负担,同时带来隐私与注入攻击的新挑战。
DeepSeek 发布并开源 V4 预览版,提供 Pro 与 Flash 两个模型,并把 1M 上下文作为官方服务标配。这不仅是一次模型升级,也是在用成本和长上下文能力重新定义开源模型的 agent 场景。
OpenAI 发布 GPT-5.5,在保持速度的同时显著提升编码、知识工作与科研表现,更重要的是把模型进一步推向可独立推进任务的执行层。
Claude Design 让设计师能够广泛探索创意方向,也让非设计背景的创始人、产品经理和营销人员能够轻松制作视觉作品——从原型、线框图到演示文稿和营销物料。
Kimi K2.6 在开源编程领域取得重大进展,支持长程代码生成、设计驱动开发、智能体集群协作和主动式智能体交互,并推出 Claw Groups 研究预览版。
微软在一项仅改动两行的合并请求中,将 git 提交自动添加 AI 共同作者的功能默认开启,引发大规模社区不满。
智能体与人机交互的 6 条核心设计原则:身份披露、原生融入、即时反馈、状态透明、尊重退出、人类问责。
输入一个应用或网站的想法,通过滚动即可浏览 AI 生成的无限设计选项。像刷短视频一样探索设计灵感。
Mistral AI 发布 Forge,让企业基于专有知识构建前沿级 AI 模型。
OpenAI 审计发现 SWE-bench Verified 存在严重的测试缺陷和训练数据污染问题,已停止报告该基准分数,并建议业界转向 SWE-bench Pro。
Figma 推出 Claude Code to Figma 功能,让开发者可以直接将代码转换为可编辑的设计稿。在 AI 时代,设计的核心工作是在无限可能性中找到最佳解决方案。