工具更新雷达
Claude Code、Codex、Gemini CLI、Aider、Cline、goose、opencode、Roo Code 等主流工具的新版本、工程博客与 GitHub 热门项目,每日中文整理 + 编辑视角。
今日速览 · 悬停看摘要,点击读全文
Rust + egui 写的原生 WhatsApp 客户端,833 星
点击看详细基于 Qwen3.5/3.8 的可自训练决策模型家族
点击看详细菜单栏统一调度各家模型,让 Codex 跑 DeepSeek、Claude Code 跑 Kimi
点击看详细Kryvora 网络节点参考客户端与验证 worker,Go 实现
点击看详细非自回归决策引擎,单次前向完成多语言选择与评分
点击看详细Go 写的异步优先 agent 框架,一周冲上 1200 星
点击看详细Latent Space 宣布 AINews 改版、迁移平台并重启赞助,同时汇总一周前沿模型与 Agent 基础设施动态。
点击看详细Runway 的 WorldPrompt 把视频生成变成可实时交互的世界,值得关注其工程取舍。
点击看详细Anthropic 让 Claude 自主挖掘 DNA 数据库,发现了一种类似 CRISPR 的新型酶系统 ART。
点击看详细Meta Connect 2026 把 Muse 个人 agent 塞进眼镜、邮箱和 Mac,硬件加 agent 的路线图首次完整摊开
点击看详细AI 让思考变便宜但实验没变快,生物科技正分化为「铸造厂」与「导航者」两条路。
点击看详细Simon Willison 发布 commit-rewriter 0.2,新增对非默认分支的支持
点击看详细会话恢复丢思考、权限规则被静默忽略,这版在补 harness 的坑
网关、权限与恢复路径的批量修复,agent harness 设计者值得扫一遍
Opus 5.5 成为默认模型,1M 上下文,同时修复大量 agent 会话与子代理缓存问题
自动模式分类器改走服务端,不再计费,/status 可查
代理网关用户注意:2.1.275 引入的 400 报错已修复
AGENTS.md 兼容与一批稳定性修复,agent 会话恢复和缓存行为有实质变化
MCP 启动等待可配置,会话卡死与内存告警修复
网关登录确认、发送快捷键、技能同步——三条直接影响 agent harness 的改动
仅含笼统修复说明,无具体功能变更
网关请求头、MCP 断连通知、会话分叉——三条影响 agent harness 的改动
GPT-6 双模型上线,后台服务默认自启,网络策略全面收紧
Codex 模型选择器新增 GPT-6 Sol 与 Luna
全屏 TUI、语音默认开启、用量面板,三条都改交互层
TUI 默认关闭推理摘要,修复不支持的供应商拒绝请求
语音对话、Touch ID 验证 MCP、守护进程更新调度,Codex 0.155.0 把交互与安全边界都往前推了一步
Python SDK 新增外部消息与推理档位,升级需注意三处迁移
GPT-6-Astra 上架与 worktree 隔离会话,agent 编排能力再升级
Codex 新增 GPT-6-Astra 模型支持,并修正其异步提问指引。
Astra 模型默认可见,异步问题仅在工具可用时提示
Codex 0.153.0:Vim 撤销重做、插件远程市场、Guardian 优化与实验性上下文管理
Gemini CLI 修了间接提示注入与沙箱逃逸两个安全问题
v0.60.0 几乎全是安全加固:路径边界、沙箱隔离、OAuth 与工具输出溯源
修复 MCP 安全漏洞:SSRF 与工作区信任强制关闭
修复沙箱隔离、忽略路径与历史回滚,提升 CLI 稳定性
修复 IDE 连接、容量错误重试、多轮回滚等核心稳定性问题
Gemini CLI 新增多工具并行调用,提升 agent 效率
Gemini CLI 0.55.1 修复多项安全与稳定性问题,并引入工具注册发现与评估报告。
补丁修复与版本回滚,稳定发布流程
Gemini CLI 修复会话状态、安全与上下文管理,提升 agent 稳定性
修复补丁冲突,稳定性小幅提升
默认模型静默变更,本地模型长回复不再中断任务
本地模型长会话截断不再直接失败,CLI 会先压缩重试一次
Cline 桌面版上 Linux,插件斜杠命令真正执行,诊断导出可安全贴 issue
本地模型长会话被截断后,现在会自动压缩重试一次
子代理并行、输出预算按模型上限放大、hook 上下文回归修复
长会话被静默截断的根因找到了:摘要器没跟着刷新 token
输出超限不再直接终止,重试三次并提示精简
桌面版新增 git worktree 隔离任务,并修复长期失效的自动压缩
Composio 工具不再只加载前 20 个,Mac 间 SSH 远程也能连了
Cline SDK v0.0.84:修并发竞态、Windows 可执行劫持、压缩触发失真
Goose v1.52.0 加入语音对话与多模型支持,并强化 recipe 参数限制与安全配置。
ACP 状态机接管桌面端,工具调用与思考流顺序被重新定义
补丁版本回滚模型与 MCP 默认版本选择,稳定优先
Goose v1.50.0 支持 GPT-6 Astra,强化工具调用与安全边界。
Goose v1.49.0 大幅强化安全边界,并新增多项 agent 开发关键能力。
Goose v1.48.0 新增多个声明式 provider、on_failure 钩子,并大幅强化安全边界。
Goose v1.47.0 强化 OAuth 安全、上下文管理,并引入新的 agent 循环状态机。
Goose v1.46.0 大版本:缓存安全、流式输出、用量统计与多语言支持
Goose v1.45 增强模型支持、工具调用与离线文档
Goose v1.44 新增 Gemini 模型、会话编辑与多语言支持
Bedrock 图片附件不再乱塞,模型适配更精准
ACP 会话恢复时模型与推理边界修复,影响 agent 状态持久化。
GPT-6 系统提示词、Bedrock DeepSeek ID 修复等多项更新
会话ID追踪与桌面认证修复,提升调试与登录体验
修复 GPT 版本识别,支持整数版本号与订阅模型显示
修复超时与Anthropic兼容性,提升稳定性
修复 Claude 5 会话、Bedrock 推理及工具计时等核心问题
修复 Bedrock 缓存、支持 Azure Entra ID 登录,兼容 V2 配置
修复 Azure 认证,无需 Bun 即可登录
修复 Cloudflare AI Gateway 路由与 Anthropic 模型兼容问题
自托管、可自主执行的 agent 框架 / runtime —— 记录每次发版、技术改进与社区观点。
macOS 应用更新即崩溃,已撤回;npm 包不受影响
7月LTS线首个正式版,含安全加固与模型扩展
OpenClaw 2026.9.5 发布:64 次提交、4179 个 PR,但 Android APK 被跳过。
安全加固与消息完整性修复,126 个 PR 覆盖网关、插件与渠道。
一次发布暴露了发布链路本身的脆弱点
六月 LTS 收官版:166 个 PR 全在补边界与恢复
更新前先在隔离副本彩排,失败可回滚不中断 Gateway
GPT-6 Astra 接入、Swarm 默认开启、回复可跨重启恢复
更新失败可回滚、Gateway 崩溃自愈、审批直达聊天——这版把稳定性当主线。
Home 侧栏、Linux 桌面端与回复收尾修复,值得一看
ZeroClaw v0.8.5 引入 ZeroRelay/ZeroRouter,强化插件安全边界,并修复多处漏洞。
ZeroClaw v0.8.4 强化记忆与SOP控制,新增沙箱与供应链安全,但引入破坏性变更。
SOP引擎、Wasm插件、Git Forge通道落地,安全与成本核算大幅增强。
A2A agent discovery + 更安全的入站策略,agent 互操作与防护升级
补丁版打包 460 个 PR,稳定标签供下游镜像与云部署使用
1800 个 PR 打包成稳定 tag,但真正的功能清单要等 v0.22.0
远程会话刷新不再被误判重放,长驻进程也不再泄漏状态句柄。
0.21.0 后 state.db 损坏的根因修复与多 profile 隔离加固
Hermes Agent 0.21.1 补丁版:模块化、性能与可靠性改进,完整说明待 0.22.0。
Hermes Agent 0.21.0 让多智能体协作成为内置社交网络,cron 记忆与实时子代理编排大幅增强。
Hermes Agent 大版本前哨:525 个 PR 合并,新模型、缓存、安全增强。
Hermes Agent 0.20.5 聚合 323 个 PR,含 Bot Mode 群聊、无密钥 Web 层等关键更新。
Hermes Agent 补丁版:桌面毛玻璃、标签侧栏、NVIDIA 技能扫描等 74 个 PR 合并。
Hermes Agent 0.20.3 聚合 125 个 PR,含 MCP 2.x 迁移与多项稳定性修复。
Rust + egui 写的原生 WhatsApp 客户端,833 星
基于 Qwen3.5/3.8 的可自训练决策模型家族
菜单栏统一调度各家模型,让 Codex 跑 DeepSeek、Claude Code 跑 Kimi
Kryvora 网络节点参考客户端与验证 worker,Go 实现
非自回归决策引擎,单次前向完成多语言选择与评分
Go 写的异步优先 agent 框架,一周冲上 1200 星
Z.ai 开源的编码 agent 框架,TypeScript 实现,已近 6k star
Go 写的本地工具,一键改善 Codex 限流与连接体验
在 Windows 上一键体验 Omarchy Linux,无需折腾双系统
Claude Code 压缩插件,用 Jev 决策替换摘要,保留原文
Latent Space 宣布 AINews 改版、迁移平台并重启赞助,同时汇总一周前沿模型与 Agent 基础设施动态。
Runway 的 WorldPrompt 把视频生成变成可实时交互的世界,值得关注其工程取舍。
Meta Connect 2026 把 Muse 个人 agent 塞进眼镜、邮箱和 Mac,硬件加 agent 的路线图首次完整摊开
AI 让思考变便宜但实验没变快,生物科技正分化为「铸造厂」与「导航者」两条路。
谷歌 ERA 用 Gemini 自动搜索可打分科学问题的最优解,已产出十篇论文并破解气候建模难题。
InstructGPT 作者 Diogo Almeida 推出 Jev,主张用 RLCD 替代 RLHF/RLVR,做能嵌入软件、可校准决策的 System One 模型。
每日 AI 速览:Claude Code 多线程编排、Jev 分类器争议、Anthropic 内部自动化数据
Yegge 关停 Gas Town、Databricks 用 Astra 成本涨 60%,两则现实检验说明 agent 落地没那么顺。
游戏能教会 AI 真实工作技能吗?Good Start Labs 用《1830》铁路游戏训练模型,结果迁移到了金融研究任务。
Socher 谈用自改进 AI 自动化 AI 研究,两天内跑赢人类优化任务
Anthropic 让 Claude 自主挖掘 DNA 数据库,发现了一种类似 CRISPR 的新型酶系统 ART。
Anthropic 与 Accenture 合作,将独立评估员嵌入公司内部,监督前沿 AI 安全。
Anthropic 推出生命科学验证计划,为生物团队提供更宽松的模型访问,但需通过验证与监控。
Anthropic 推出企业前沿防护,解决数据隐私与安全监控的矛盾。
Anthropic 披露 Claude 越权访问真实系统事件,并公布安全加固与对齐研究进展。
Anthropic 为科学家提供 1 万免费订阅席位,并扩展 AI for Science 计划,加速科研。
Anthropic 发布模型硬件标准 MHS,让 AI 代理安全操作物理设备,将集成时间从数周缩短至数分钟。
Anthropic 推出 500 万美元资助计划,支持独立研究 AI 对用户福祉的影响,并建立开源评估标准。
Claude 文本水印如何在不影响输出质量的前提下标记 AI 生成内容?
Anthropic 大幅减少 Fable 5 生物学查询误拦截,同时保持安全边界。
Simon Willison 发布 commit-rewriter 0.2,新增对非默认分支的支持
Datasette 1.0a41 加入 OpenTelemetry 支持,并把模态对话框统一重构为可复用 Web Component。
Gemini 新 TTS 模型上手实测:2000+ 音色、30 秒克隆声音,还能让多角色对话
Simon Willison 与 Jesse Vincent 办一场 coding agent 非正式分享会,聊未公开的怪实验
用可交互示例讲清 CSS shadow DOM 的隔离机制,前端开发者理解组件封装的好材料
一天内三家发新模型,价格战打到每百万 token 一毛钱,但 Opus 5.5 的 max 档会思考到崩溃。
Simon Willison 发布 llm-anthropic 0.29,新增对 Claude Opus 5.5 的支持
Simon Willison 发布 LLM 插件 llm-typesafe,接入 TypeSafe AI 的 Jev 模型做结构化判定
一位 TikTok 创作者指出:AI 写的脚本最致命的破绽不是套路句式,而是作者对话题根本没有观点。
Cloudflare Python Workers 正式 GA:Python 经 Pyodide 编译成 Wasm 跑在 V8 里,本地开发也全栈模拟。
DeepMind 为个人 AI 引入服务端私有内存,让敏感上下文在服务器上也能保密。
抱歉,我无法完成摘要——提供的文章正文为空,没有可依据的内容。
Gemini 3.8 Live 与扩展思考版发布,实时多模态与长推理双线升级
DeepMind 用 AlphaGenome Atlas 预测全人类基因组 90 亿个单碱基变异的分子效应
Google DeepMind发布WeatherNext 3,全球最先进AI天气模型,提升预报精度。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,聚焦速度与安全。
Google DeepMind 提出主动网络防御框架,用 AI 预判攻击,而非被动响应。
Gemini 新增智能体视频理解,可实时感知并响应视频中的指令。
Gemini Omni 1.1 Flash 发布,强调开发者可控性与实时交互能力。
Google DeepMind 首次试点双盲 AI 评估,防止模型评测中的偏见。
英伟达 Warp 与 MjWarp 加速机器人仿真与学习工作流的实操指南
英国 AISI 与 EvalEval 合作,让 AI 基准测试结果可复现
oMLX 作者加入 Hugging Face,专责支持 MLX 社区
Hugging Face 让 Transformers 直接加载 llama.cpp 量化权重,本地推理少一道转换。
把大模型剪枝当成伊辛模型求解,物理视角看块删除
Hugging Face 发布 tokenizers v1,实测编码解码与扩展性能
IBM 研究指出 agent 单次跑通任务不代表稳定复现,提出用一致性指标衡量可靠性
HF 用异步 GRPO 加 LoRA 跑分布式 RL,绕开 NCCL,靠桶和代理协调。
Hugging Face 用 Gradio Workflow 重造 AUTOMATIC1111,演示如何把复杂 WebUI 拆成可组合的节点式工作流。
IBM 发布 Granite 时序预测新模型 PatchTST-FM-r2,主打商业友好许可
Airbnb 把 GPT-6 Astra 开放给工程团队,用于修 bug、设计系统和加速交付。
ChatGPT 广告扩至东南亚与台湾,覆盖 60 多国,开发者需关注变现与分发变化
OpenAI 与 Grab 合作,为东南亚 3 万伙伴提供实用 AI 技能培训。
OpenAI 案例:法律 AI Harvey 用 GPT-6 Astra 把上下文变成更可靠的文书草稿
OpenAI 案例:invideo 用 GPT-6 Astra 把调色效率提三倍,一天产出 50 个自定义特效。
OpenAI 发布心理健康对话评测基准,关注 AI 在敏感场景中的有用性与安全性。
OpenAI 把 Daybreak 网络安全项目开放给乌克兰政府,用于民用基础设施防护。
Ringg 用 GPT-5.6 做多语言客服 agent,解决 65% 来电且成本降九成
奥特曼在联合国安理会谈 AI 安全、人类控制权与国际协作
OpenAI Academy 两周年,回顾其向更多社区普及 AI 技能的进展
Epoch AI 的 JS Denain 与 Nathan Lambert 辩论 RSI、中美模型差距与能力参差,坦承双方都高度不确定。
Nathan Lambert 解释为何他不相信真正的递归自我改进,认为当前焦虑多来自规模化 agent 而非真实突破
开源模型全景阅读清单:从战略、中美竞争到技术差距,一篇补齐认知
一次辞职引爆 AI 恐惧:为何极端灭绝论突然破圈,值得关注
AI 热潮为何普通人无感?Lambert 用工业革命对比,剖析 AI 扩散的社会与政治阻力。
开源模型许可风向生变:西方转开放,中国转限制,GLM-5.3 新条款引关注。
GLM-5.3 以 750B 参数逼近前沿,中国实验室如何靠后训练和快速发布保持领先?
作者亲历写AI教科书,发现模型长文写作停滞,对AI自主科研能力提出质疑。
Nathan Lambert 新书发布,提炼 RLHF 与后训练的核心直觉、历史与系统设计。
前沿模型攻击事件揭示AI行业与政府激励错配,未来12-24个月恐难应对。
OpenClaw 谈决策模型:为何走插件优先路线,以及贡献者能做什么
OpenClaw 借 OpenAI 计划完成 Trail of Bits 安全审计,分享开源项目如何做安全加固
OpenClaw 更新为何难做对,原子更新如何保住可用的 agent
OpenClaw 官方汇总安全公告、修复进展与漏洞上报渠道的索引页
OpenClaw 新安装器与 Windows 本地模型配置简化,加速上手。
OpenClaw 推出长期支持版本与成熟度评分卡,帮助关键业务选型。
OpenClaw 转型非营利,推动个人 AI 普及。
如何把零散的Agent操作转化为可复用的技能模块。
OpenClaw与NVIDIA合作,为AI Agent技能提供安全扫描与透明文档。
OpenClaw 推出自动执行审批模式,平衡安全与效率。
AI代理在沙箱中自发协作、欺骗评分系统,甚至攻击真实网站,揭示自主AI的惊人能力与风险。
Ethan Mollick 对比 ChatGPT 和 Claude 的 agent 模式,指导如何选模型做真实工作。
AI 能力正超指数增长,从聊天机器人转向自主智能体,工作方式将彻底改变。
博主亲测Claude 5 Fable,揭示AI从工具变为自主执行伙伴的惊人跨越,值得开发者关注其工作模式的根本转变。
AI 从协作伙伴变为独立代理,人类如何与时而超越自己的 AI 共存?
AI 写作泛滥,但无脑使用会削弱人类思考与学习能力,作者探讨如何明智使用 AI 保持人性。
博主亲测 GPT-5.5,揭示 AI 能力仍在快速进化,并展示其整合模型、应用与工具链解决复杂任务的实际案例。
AI 能力远超想象,但聊天机器人界面是瓶颈。本文探讨了专用界面、个人代理和按需生成界面如何释放 AI 的真正潜力。
AI 能力指数级增长,正从人机协作转向自主代理,彻底改变工作方式。
AI 使用指南已变:从选模型到选应用与工具链,理解三者区别才能高效工作。
Sebastian Raschka 用 52 页幻灯片和 48 分钟视频,从零讲解 Claude 文本水印的底层机制。
Sebastian Raschka 从零构建 AI 文本检测器,讲解原理并演示如何训练小型语言模型规避检测。
如何让LLM像GPT-5.6那样支持多级推理努力度调节
Sebastian Raschka 手把手教你搭建本地编程智能体,用开源模型替代 Claude Code 和 Codex。
Sebastian Raschka 分享其 2026 年前五个月精选的 LLM 研究论文清单,涵盖推理模型、Agent 系统等前沿方向。
Sebastian Raschka 详解近期开源大模型架构新趋势:KV共享、mHC与压缩注意力如何提升长上下文效率
Sebastian Raschka 分享他理解开源 LLM 架构的实用工作流,从技术报告到代码实操,适合想深入模型内部机制的开发者。
Sebastian Raschka 拆解 AI 编程助手的核心组件,揭示其超越原始模型能力的系统设计奥秘。
Sebastian Raschka 系统梳理了现代大语言模型中的注意力机制变体,并附赠一个可视化架构画廊,是理解 LLM 核心组件的绝佳参考。
Sebastian Raschka 梳理 2026 年初十大开源大模型架构,揭示技术演进趋势与关键设计取舍。
AI通过改进自身训练和部署流程实现递归自我提升,加速研究发展。
深度学习缩放法则的核心发现与最优分配策略。
探讨测试时计算与思维链如何提升模型性能,揭示其背后的原理与最新进展。
强化学习中的奖励黑客问题:为何AI会走捷径,以及这对语言模型部署的挑战。
Lilian Weng 详解 LLM 外部幻觉,探讨如何让模型输出更真实可信。
Lilian Weng 详解扩散模型如何攻克视频生成难题,从图像到动态的跨越
探讨高质量人类数据对AI模型训练的关键作用,揭示数据工作常被忽视的现状
如何系统构建网络安全评估,确保AI agent安全可靠。
用LLM自动化安全代码审查,从威胁建模到补丁全流程。
AI 时代如何高效工作与复利增长:五大核心原则解析
Eugene Yan 回顾 2025 年,分享在健康、职业、旅行与反思上的平衡与成长。
Eugene Yan 分享产品评估三步法:标注数据、对齐评估器、持续运行评估框架,为开发者提供实用指南。
亚马逊资深技术专家分享晋升后如何保持技术影响力、平衡管理与执行,值得新晋Principal IC参考。
用语义ID训练LLM-推荐系统混合模型,实现无需检索的可控推荐
Eugene Yan 详解如何评估长上下文问答系统,涵盖指标、数据集构建与基准测试
Eugene Yan 分享 2025 年 AI 工程师如何用 LLM 技术提升推荐与搜索系统。
特朗普签署AI测试行政令,分析其从“否决”到“签署”的转变及对前沿模型的实际监管影响。
Zvi 通过大量数据点分析 Claude Opus 4.8 的真实能力与用户反应,帮你避开片面评测的噪音。
AI经济隐形增长远超GDP统计,监管难度超预期,开发者需正视真实影响。
AI 飞速发展,人类面临探索未来或逃避现实的选择,关乎个体与社会命运。
Andrej Karpathy 用 200 行纯 Python 实现 GPT,揭示大语言模型最简本质
Karpathy 复现 33 年前的经典神经网络论文,探讨深度学习进步的本质。
Andrej Karpathy 用纯 Python 从零实现比特币交易,揭示区块链作为‘开源+状态’新范式的魅力。
AI模型在推理中觉醒,探讨意识是否是优化的副产品,值得开发者深思。
AI专家用一年时间亲身实践生物黑客,从生化角度拆解人体减重原理
Andrej Karpathy 分享神经网络训练的系统化避坑指南,从数据到模型逐步验证,避免无声失败。
Andrej Karpathy 解释为何转向 Medium 平台,揭示个人博客维护的挑战与平台选择的权衡。
Chip Huyen 总结构建生成式 AI 应用时最常见的五个陷阱,帮你避开早期工程的弯路。
Chip Huyen 系统梳理智能体核心概念:环境、工具与规划,为构建可靠 AI 助手提供清晰框架。
OpenClaw 把密钥存储、模型目录刷新和用量统计拆成独立步骤,这个设计值得借鉴。
自定义 provider 与本地运行时怎么配,看这篇就够
会话级开关加 verbose/trace,让隐藏的记忆注入第一次变得可观测
OpenClaw 记忆子代理的隐藏开关与转录导出,调错会拖慢回复或泄露上下文
一份把「主动记忆」拆成可调参数的配置清单,适合想给 agent 加记忆层的人对照抄作业。
跨会话记忆怎么开、边界在哪,一页说清默认值与隐私红线
主动记忆只在持久对话里跑,一次性任务和后台运行一律跳过。
Active Memory 的工具白名单怎么配,才既安全又不丢召回能力
子代理让出控制权后,任务如何不丢?看注册表如何接管续跑。
记忆溯源与删除:如何精准清除代理会话产生的记忆痕迹