🛠️ OpenClaw 2.0:把个人 Agent 做成可持续运行的系统
一句话
OpenClaw 是可自托管的个人 AI 助手与 Agent 运行时,2.0(官方版本号为 v2026.8.1)重点扩展了会话搜索、跨设备/云端执行、持久进度卡、交互式组件、凭据保护、自动化权限、记忆、MCP、插件和多端客户端。
怎么玩
想快速试用,先看官方仓库的安装说明;正式安装可使用 npm 安装最新版本,或克隆仓库后按 pnpm workspace 流程安装并构建。第一次运行不要直接接入真实账号和高权限目录,先准备一个测试工作区,配置一个低权限模型和单独的 API 凭据,再让 Agent 完成“读 README、列出文件、生成测试计划”这类可回滚任务。重点体验会话进度、权限确认、MCP 连接和跨设备执行;升级到 v2026.8.1 前先备份配置与状态,并运行 doctor 检查迁移结果。
为什么值得关注
这不是单一聊天壳,而是在向 Agent 操作系统靠拢。官方更新同时覆盖模型路由、凭据隔离、会话记忆、工作板、MCP、插件信任、云端 Worker 和权限模式,说明竞争焦点已从“模型能不能回答”转为“能不能长期运行而且出了问题可追踪、可恢复”。不过版本变更面很大,OpenProse 和 OpenAI 路由均有迁移事项,不能把一次升级当成无风险更新。
应用场景
- 把 Telegram、网页和本地终端统一成一个可审计的个人工作 Agent。
- 为代码维护、定时巡检、资料整理等任务建立带审批和恢复能力的自动化流程。
🛠️ OJO Design Skills:给 Coding Agent 加一套设计决策协议
一句话
OJO Design Skills 是面向 Codex、Claude Code、ZCode 等 Coding Agent 的开源 UI/UX skill 包,用设计方向、设计 token、组件规范、交互状态和反 AI-slop 规则约束页面产出。
怎么玩
先在一个前端测试仓库里阅读 README 和 references,再用官方安装脚本按目标客户端安装;例如 Codex 可执行 `curl -fsSL https://raw.githubusercontent.com/touchine-ojo/OJO-Design-Skills/main/scripts/install.sh | bash -s -- --target codex --force`。安装后让 Agent 先对现有页面做设计审计,再要求它给出两到三个风格方向,选择一个方向后生成 token、组件和页面。最后用浏览器截图或实际交互逐项验收颜色、间距、空状态、错误态、移动端适配,不要把“装上 skill”误当成设计质量已经保证。
为什么值得关注
它的价值不在于再提供一套漂亮提示词,而在于把“凭感觉做页面”拆成可复用的判断步骤。仓库明确提供 Convention 和 Innovation 两条路线,并加入反渐变、真实图片、交互状态和 spring motion 等护栏,尝试把审美偏好转成 Agent 可读取的工程约束。项目规模仍小,适合当作实验性基线,不宜直接视为成熟企业设计系统。
应用场景
- 让 Vibe Coding 生成的落地页、后台和产品原型保持统一品牌语言。
- 在多人协作中把设计评审标准沉淀成仓库内可复用的 Agent skill。
🛠️ DeepSeek-V4-Flash-Vision-Exp:把视觉输入接入 Agent API
一句话
这是 DeepSeek 的实验性多模态模型,除文本 Agent、推理和知识能力外,可接收图片并用于截图理解、图表分析、OCR 辅助和视觉 Agent 工作流。
怎么玩
先在 DeepSeek API 文档申请密钥,使用官方模型名 `deepseek-v4-flash-vision-exp`,优先从 Vision 指南中的 OpenAI 兼容 Chat Completions 示例开始。准备一张不含隐私的截图或图表,用 URL、Base64 或 Files API 传入图片,再要求模型输出结构化 JSON,例如“识别表格列名、读取关键数值并标注不确定项”。随后接入一个只读工具,让 Agent 根据截图提出下一步操作但不自动执行。图片按最多 384 tokens 计费,模型仍标注为 experimental,生产使用要准备文本模型或传统 OCR 的回退路径。
为什么值得关注
官方文档给出的组合方式很实用:同一个模型同时支持混合文本+图片输入、Chat Completions、Messages 和 Responses,还能复用 Files API 中的图片。这样视觉理解不必再单独拼一个“图片描述器”,可以直接进入工具调用和任务规划。需要注意的是,官方能力宣称与实际业务准确率不是一回事,尤其是密集 OCR、小字截图和复杂图表,必须用自己的样本集验收。
应用场景
- 让代码 Agent 读取界面截图、报错截图和流程图,再生成修复或测试计划。
- 对发票、仪表盘、商品图等图片做初步结构化抽取,并交给人工复核。
🛠️ Hyper3D WorldGen:从一张图走向可拆解的三维场景
一句话
Hyper3D 展示的 WorldGen 目标不是只生成一个孤立 3D 资产,而是从场景图片中重建多个独立物体、空间关系和物理约束;目前官方公开入口更明确的是 Hyper3D Rodin 的图生 3D/API,WorldGen 的具体开放范围仍需以官方页面为准。
怎么玩
先在 Hyper3D 官网注册,进入 Rodin 的 Image To 3D 工作区,用一张主体清晰、背景干净的物品照片生成 GLB/GLTF 等资产,观察网格、材质和可编辑性;如果需要自动化,再阅读 API 文档,按“提交任务—轮询状态—下载结果”的异步流程接入自己的脚本。对于 WorldGen 本身,先把 X 帖子中的场景案例当作能力演示,不要默认每个账号都能调用;可先用客厅、桌面或产品陈列图做人工评估,分别记录物体分离、遮挡补全、尺度关系和碰撞合理性。
为什么值得关注
如果生成结果真的包含独立 Mesh、场景布局和物理属性,3D 生成的价值就从“做一张好看的图”提高到“给仿真、游戏、XR 和空间设计提供可继续加工的世界”。Hyper3D 公开资料也显示 Rodin 已覆盖图生 3D、文本生 3D、API 和多种导出格式。当前最大的不确定性是 WorldGen 的公开可用性、稳定性和复杂场景误差,先把它当作值得实测的早期产品,不宜直接按宣传效果估算生产成本。
应用场景
- 从房间或展台照片生成可用于 XR/装修原型的三维草模。
- 为机器人仿真、游戏关卡和影视预演快速建立可拆分场景资产。
🛠️ ColaMD 2.0:让人和 Agent 同时盯着 Markdown 工作
一句话
ColaMD 是开源、跨平台的 Agent Native Markdown 编辑器;Agent 修改打开的 `.md` 文件时,编辑器实时刷新,并提供所见即所得、Mermaid、任务列表、主题、PDF/HTML/Word 导出和多窗口等能力。
怎么玩
macOS、Windows 或 Linux 用户直接进入 GitHub Releases 下载对应安装包;也可以克隆仓库后按 README 执行 `npm install` 和 `npm run dev`。打开一个专门的 Markdown 项目目录,在 ColaMD 中载入文件,再让 Claude Code、Codex 或其他 Agent 修改同一个文档,观察实时同步和标题栏 Agent Activity Indicator。先用日报、会议记录或项目设计文档测试,再试 Mermaid、PDF/HTML/Word 导出;涉及重要文档时保留 Git,因为实时刷新解决的是观察问题,不等于替你做版本管理。
为什么值得关注
很多 Agent 工作流的痛点不是生成不出文字,而是人不知道 Agent 正在改什么、改完是否落盘、如何快速审阅。ColaMD 把 Markdown 当作内容层,把编辑器当作可视化协作面,既不要求迁移到云端,也不内置一个黑盒 AI。对经常让 Agent 改 README、方案、简历和知识库的人,这种“边写边看”的反馈环很直接;但项目仍在快速迭代,建议先在副本中使用。
应用场景
- 让 Agent 维护项目文档、日报、知识卡片并实时人工验收。
- 把 Markdown 直接导出成网页、PDF、Word 或可分享的阅读页。
🛠️ Mole 1.13:macOS 上的清理、卸载与状态检查工具
一句话
Mole 是 macOS 开源 CLI,集清理缓存、卸载残留、磁盘分析、优化、项目产物清理和系统状态监控于一体;免费 CLI 与收费原生 Mac App 是两个产品形态。
怎么玩
在终端执行 `brew install mole` 安装稳定版,然后先运行 `mo --version` 和 `mo analyze` 了解当前磁盘情况。任何删除动作都先使用 `mo clean --dry-run`、`mo uninstall --dry-run` 或 `mo installer --dry-run` 查看候选路径,确认不会误删开发缓存、同步目录或业务文件后再执行;需要清理项目构建物可单独用 `mo purge`。如果偏好 GUI,可到 mole.fit 试用原生 Mac App,但要注意它和 GPL-3.0 的 CLI 不同,收费与许可规则也不同。
为什么值得关注
它与生成模型不是同一类工具,却正好补上本地 Agent 工作站的基础设施:模型下载、构建缓存、日志和旧安装包会持续吞噬磁盘,卸载软件还常常留下 LaunchAgent 和偏好文件。Mole 把清理前预览、残留关联和系统状态放在同一套工具里,尤其适合开发者机器。不过清理工具拥有删除能力,任何“可安全”判断都不能替代人工复核和备份。
应用场景
- 定期清理本地模型、Node/Python 构建物和安装包留下的磁盘占用。
- 在运行长时间 Agent 或编译任务前后快速检查 CPU、内存、磁盘和网络状态。
🛠️ Miya.fm:把 X 帖子或照片变成可分享的音乐视频
一句话
Miya.fm 是一个处于 Beta 的社交化 AI 音乐产品,官网提供 Playground;官方页面描述为把生活素材变成音乐,X List 用户实测的主要玩法是输入 X 帖子、个人页或图片生成带歌词的吐槽式歌曲/视频。
怎么玩
打开官网进入 Playground,先用一条不含私人信息的公开 X 帖子或一张普通照片测试;根据页面提供的创作模式粘贴链接或上传素材,补充希望的情绪、吐槽角度或音乐方向,再提交生成。第一次建议只做短内容,记录生成等待时间、歌词是否误读原文、是否出现不适合公开的个人信息,以及成品能否下载/分享。官网当前标注 Beta 期间免费,并提示桌面端仍在准备中,因此不要把 X 账号授权、付费规则和长期可用性想当然,发布前先人工检查版权与隐私。
为什么值得关注
它把“音乐生成”从写提示词改成了社交内容再创作:用户不需要先懂曲风,只要提供一个已有素材,产品就把它转成歌曲和视频。这种入口更适合短视频、朋友互动和内容二创,也更容易形成传播。另一方面,引用真实人物帖子会带来肖像、隐私、诽谤和版权边界,产品越是低门槛,越需要在分享前做人工审核。
应用场景
- 把公开帖子、活动文案或照片快速变成社交平台上的趣味短视频。
- 为品牌活动、播客片段和个人纪念内容做低成本音乐化草稿。
🛠️ fal.live:尝试“观众提示词驱动”的实时互动直播
一句话
fal.live 是 fal 生态推出的互动 AI 直播网站,X 帖子描述的玩法是选择频道、输入接下来想发生的事情,然后观看内容实时生成;fal 官方开发平台同时提供统一的图像、视频、音频、音乐和实时模型 API。
怎么玩
打开 fal.live,先浏览公开频道,确认页面是否允许直接观看或需要登录;进入可交互频道后,用短而明确的提示测试,例如改变场景天气、镜头方向或下一段事件,不要一上来输入复杂长剧本。记录提示提交到画面变化之间的延迟、是否能连续保持角色/场景一致、互动次数限制和是否有内容过滤。开发者则先在 fal Sandbox 里比较模型,再按官方文档使用统一 API;任何面向公众的实时生成都要设置预算、速率限制、内容审核和超时回退。
为什么值得关注
它把生成式媒体从“一次生成一个文件”推进到“边看边影响剧情/画面”,产品形态更接近游戏、直播和互动叙事。fal 的统一模型入口降低了搭建实验的门槛,但实时场景的难点不只是模型质量,还包括延迟、状态保持、并发成本和不确定输出。当前 X 帖子对 fal.live 的具体频道和限制描述有限,适合亲自点开验证,不宜据此推断完整商业能力。
应用场景
- 做互动直播、观众参与式剧情和实时视觉实验。
- 为游戏原型、展览和品牌活动测试“提示词即控制器”的体验。
📡 Uber 把 Agent Coding 做成可度量的软件工厂
事件
Uber 官方工程文章披露,超过 70% 的 Pull Request 可归因于本地或云端 Agent,内部已建立 3600 多个 skills,每天执行超过 3 万次。
解读
这条信息的价值不只在“70%”这个比例,而在于 Uber 同时公开了成本方程和度量方法:用户数、会话数、每会话轮数、每轮请求数、Token 数和单价共同决定 Agent 总成本。官方还把代码生成、验证、部署、观察和维护拆成层级,并建设包含数千万节点和边的上下文图。它说明大规模采用的瓶颈并不是再买一个更强模型,而是让 Agent 找得到上下文、能被验证、出了问题有人工升级路径。
影响评估
企业软件开发会从采购单点 Copilot,转向建设内部上下文图、skill 注册表、评测集、权限边界和成本看板。对中小团队而言,不必复制 Uber 的规模,但可以先追踪每个 Agent 任务的成功率、返工次数、人工审查时间和单位成本;否则“提交量增加”很容易掩盖维护负担和低质量代码。
📡 Gemini Notebook 改为按计算量滚动刷新使用额度
事件
Google 官方公告称,Gemini Notebook 将采用与提示复杂度、对话长度、来源数量和所用功能相关的计算型额度,并从 2026-09-02 起向消费者 Web 和移动端逐步推出。
解读
X 帖子把它概括成“五小时限制”,但官方原文的准确表述是额度每五小时刷新一次,且不同任务消耗并不相同;达到额度时,Video Overviews 或 Slide Decks 等输出可以延后生成,并支持通知。这个变化反映出长上下文、来源检索和多媒体生成的产品计费,正在从简单的“每天几次”转向按计算预算管理。用户体验可能更连续,但也更难凭一次任务直观预测还能用多少。
影响评估
研究、教育和内容生产用户需要把“额度”纳入工作流设计,长报告可拆分、重输出可排队、素材数量要控制;产品方则必须把消耗原因、剩余额度和延后任务讲清楚,否则用户会把复杂度相关的限制理解成降级或变相涨价。对 Agent 产品来说,这也是按任务预算和优先级调度的先例。