今天的信号很集中:模型能力继续向“长程执行、工具调用、可验证交付”推进,但真正拉开差距的正在从单一模型分数转向 Agent harness、上下文记忆、工具设计和成本控制。与此同时,空间智能、视频理解和本地设计工作流都出现了可以亲手试用或申请体验的新入口;低证据传闻仍然不少,以下已把它们单独放到早期信号区。
今天的信号很集中:模型能力继续向“长程执行、工具调用、可验证交付”推进,但真正拉开差距的正在从单一模型分数转向 Agent harness、上下文记忆、工具设计和成本控制。与此同时,空间智能、视频理解和本地设计工作流都出现了可以亲手试用或申请体验的新入口;低证据传闻仍然不少,以下已把它们单独放到早期信号区。
把 Claude Design 的设计方法打包成可在 Claude Code、Cursor、Codex 等本地编码 Agent 中运行的 Skill,生成自包含 HTML 的界面稿、原型、线框图、落地页、仪表盘和演示文稿。
先打开 GitHub 仓库,按 README 将 `skills/baoyu-design` 安装到自己使用的 Agent Skill 目录;然后在项目目录中启动 Claude Code、Cursor 或其他支持文件读写的 Agent,给出一个具体设计任务,例如“为现有产品做一个三屏后台原型,输出可直接打开的 HTML”。让 Agent 先读取现有代码或截图,再生成设计文件,用浏览器打开 HTML 检查交互和布局,最后继续用自然语言指出某个按钮、间距或颜色需要修改。整个过程不需要上传到 claude.ai/design,产物留在本地仓库,适合反复迭代。
它不是又一个在线图片生成器,而是把设计流程变成可复用的 Agent Skill。仓库公开、MIT 许可,支持输出自包含 HTML,并提供多种设计与导出方向;对开发者而言,价值在于让“先做可视化原型、再写功能”进入代码仓库,而不是停留在一次性聊天截图。
一个本地优先、开源、BYOK 的 AI 设计工作区,让已有的 Claude Code、Codex、Cursor、Gemini CLI 等 Agent 负责生成原型、网页和设计产物。
从 GitHub 仓库进入 README,先确认本机 Node.js 与 pnpm 环境,再按项目说明安装依赖并启动开发服务;如果只想快速体验,直接打开官网入口,观察是否仍可免注册使用。实际操作时可以给出一个明确的页面目标、品牌色和参考截图,让它生成落地页或仪表盘;随后在预览中逐项反馈层级、字体、组件和交互问题,再让 Agent 修改。建议先用一个小页面验证本地 Agent 是否被正确发现,再尝试导出 HTML、PDF 或 PPTX,并把生成结果和提示词一起保存到项目中。
它把设计工具的竞争焦点从“谁提供一个更漂亮的生成界面”推向“谁能把设计能力接入开发者已有的 Agent 工作流”。公开仓库和官网资料显示,它强调本地优先、BYOK、多种编码 Agent 适配和可导出的真实产物;这对不想被单一模型或云端编辑器锁定的团队尤其有吸引力。
AWS 体系内开源的生产级 Agent SDK,提供 Python 与 TypeScript 版本,覆盖工具调用、MCP、Hooks、评测、流式输出和部署相关能力。
Python 用户可以先执行 `pip install strands-agents`,TypeScript 用户执行 `npm install @strands-agents/sdk`;随后按照官方 Quickstart 创建一个最小 Agent,先接入计算器或本地函数工具,验证“模型—工具—结果”的循环,再逐步加入 MCP 服务、BeforeToolCall Hook 和结构化输出。建议从一个能在本地完成的任务开始,例如读取文件、调用一个 API 后生成带来源的 Markdown 报告;跑通后再把工具权限、超时、日志和评测用例补齐。需要接入编码 Agent 时,可参考官网给出的 `uvx strands-agents-mcp-server` 配置。
Strands 采用 model-driven 的轻量路线,不强迫开发者先搭一套复杂的图编排系统;官方页面同时给出 Python、TypeScript、MCP、Hooks 和 Evals 的入口,GitHub 仓库还是多包 monorepo。对希望从 Demo 走到生产的团队,统一工具协议、可观察性和评测接口比再增加一个“会聊天”的 Agent 更关键。
面向终端软件工程任务的 Agent harness 评测站和公开任务集,用通过率、成功任务中位成本、单任务成本和缓存命中率等指标比较不同编码 Agent。
先打开评测站,查看 Codex、Claude Code、OpenCode、Kimi Code、DeepSeek Harness 等已测 harness 的任务通过情况和成本,再进入 GitHub 仓库了解任务定义与运行方式。不要只看榜单第一名:先把“通过率”和“每个成功任务成本”分开记录,再抽取一个自己熟悉的终端任务复现。若要测试自己的 harness,先按仓库说明准备固定版本、统一机器环境和黄金检查点,然后运行一小批任务,保存失败样本、耗时、token 与重试次数,最后再和公开结果对照。
这个项目把“我的 Agent 感觉更聪明”变成可复核的工程问题。官网明确提醒,失败任务被排除会让成本失真,缓存命中率也不等于成本,而且当前 v1.0 主要覆盖软件工程与终端任务,不能外推到所有知识工作。它更适合帮助团队找出 harness、工具和验证环节的瓶颈,而不是制造一个脱离任务分布的总榜。
Gemini 的视频 Agent 能主动选择要扫描的片段、帧率、音频或字幕,而不是固定帧率把整段视频全部塞进上下文。
先打开 Google AI Studio 或 Gemini API 的视频理解文档,准备一段 10 分钟以上、包含多个事件的视频或 YouTube 链接;在 API 的视频输入配置中把 processing 设为 `agentic`,然后提出一个需要定位时刻的问题,例如“找出所有出现故障的片段并给出时间戳”。把同一问题分别用默认静态处理和 agentic 处理跑一次,记录 token、延迟、命中片段与答案准确性。若处理企业会议或课程,建议让模型先返回时间戳和证据片段,再进行摘要,避免只拿一段无定位的长文本作为结果。
官方说明该能力可动态检索视频中的视觉、音频和转录信号,并报告最高 88% 的 token 消耗下降、最高 66% 的分析成本下降以及最高 7% 的准确率提升。真正有价值的不是宣传数字本身,而是把视频分析从“预先决定采样率”改成“围绕问题主动取证”,这会显著降低长视频检索的工程复杂度。
World Labs 的 Atlas 原生处理文本、图像、视频和 3D,可进行相机控制生成、稀疏视图空间重建、时空模拟以及点云或 3D Gaussian splat 输出。
Atlas 目前不是公开免费 API,官方入口是申请 early access;先在产品博客阅读相机控制、单图新视角、两到多张图重建和 3D 输出示例,再通过页面的申请入口提交使用场景。准备体验材料时,最好选一组有明确空间关系的照片,并写清楚希望控制的镜头路径、输出格式和是否需要可编辑 3D 几何。拿到访问后,先用一张图测试“看不见的背面”是否符合预期,再逐步增加真实视角,比较模型想象部分与输入证据之间的差异,不要把生成结果直接当作测绘数据。
Atlas 的重点不是普通文生图,而是把多模态输入放进共享的空间上下文,并同时面向生成、重建和模拟。官方披露它可以从少量图片重建场景,生成可控相机路径,并输出点云或 Gaussian splat;这条路线连接了创意工具、3D 内容、机器人仿真和空间智能,值得观察其早期访问开放后的真实可用性。
一个包含 350 套版式案例的开源视觉布局参考库,按视觉原则、编辑设计、字体、网格、网页 UI、电影、中国艺术和演示文稿等主题组织。
先克隆仓库或直接浏览 GitHub 中的案例,把自己的任务限定为一种输出,例如海报、网页首屏、PPT 封面或知识卡片;先按主题筛选,再从三到五张候选布局中比较标题层级、留白、网格、图片比例和信息密度。不要直接复制案例,先让设计 Agent 根据候选布局写出“可迁移规则”,再换成自己的文字、图片和品牌色,最后把成品与参考案例并排检查。这个流程也可以和 baoyu-design 或 OpenDesign 结合,但本条只讨论版式资料库本身。
它不是自动生成器,而是一个可以直接喂给人和 Agent 的结构化视觉参考集。仓库公开且持续更新,覆盖主题足够广,能把“做得不好看”拆成可讨论的构图、层级和网格问题。对使用 AI 做网页、海报或演示的人来说,先选参考再生成,往往比反复修改一句泛化提示词更稳定。
Google 于 2026 年 9 月 2 日发布 Gemini 3.8 Flash 及面向可信防御者的 3.8 Flash Cyber,主打长程编码、自治 Agent 和网络安全任务。
官方发布页把这次升级定义为在接近 3.7 Flash 速度和低成本的前提下提升推理与编码能力,并特别强调 DeepSWE v1.1 等长程软件工程任务。Cyber 版本则面向 Fairwind Program 的可信防御者,覆盖漏洞发现和自动修补。需要注意的是,推文和社区截图中的“超过某个大模型”只能作为线索,不能替代统一环境复测;更值得观察的是 Google 是否能把更强的持续工具调用稳定地交付给普通开发者,而不只是展示单次 benchmark 峰值。
如果低价 Flash 模型在长任务中保持足够的可靠性,编码 Agent 的成本结构会继续下移,开发者可能把更多步骤交给模型,再用评测和权限系统兜底。Cyber 版本的受限访问也说明安全能力正在从单纯防护转向授权防御者使用;企业采购时需要同时评估数据边界、调用审计、误报和提示注入防护,而不是只比较 token 单价。
Anthropic 发布通用的 Claude Fable 5.1,并以更严格的访问计划提供面向网络防御和生命科学的 Mythos 5.1。
Anthropic 官方说明两者是同一基础模型、不同安全防护级别;Fable 5.1 面向编程和知识工作,典型工作负载价格预计比 Fable 5 低约 25%,高度 Agent 化工作负载的节省最高约 45%。官方评测还把 Terminal-Bench、CursorBench、OSWorld 和研究任务放在成本曲线上比较。对用户而言,真正的新变量是“努力档位、缓存读取、长任务 token 消耗和安全拦截”一起决定总成本,不能只看模型名称或单次回答质量。
模型厂商正在把产品分成通用生产力层和受控高风险能力层,企业的模型选择会越来越像权限与风险治理问题。对编码团队来说,低或中 effort 可能提供更好的性价比,高 effort 则适合难题但会放大延迟和账单;对安全、生命科学等行业,可信访问、数据留存和审计能力可能比公开榜单排名更决定能否落地。