📡 AI 资讯日报

2026-09-01
🔥 今日主线

今天的信号集中在“Agent 从会生成,走向可控、可验证、可持续运行”:OpenClaw 2.0 把权限、记忆、工作流和多端执行继续产品化;OJO、ColaMD 等项目则分别从设计约束和人机协作界面补齐工程链路。另一条明显支线是多模态能力继续下沉——DeepSeek 把视觉输入接入 Agent API,Hyper3D 尝试把单张图片提升为可编辑、可交互的三维场景。 说明:本次 X List 抓取成功,共 103 条;Agent Reach 多源证据脚本运行超时,未生成日期限定的 evidence/evidence-summary 文件。因此,正文中的可上手项目均补查了官网、GitHub、官方文档或可信网页;证据较弱、只有 X 线索的内容统一放入“🌱 刚露头/早期信号”,不把猜测写成已证实功能。

🛠️ OpenClaw 2.0:把个人 Agent 做成可持续运行的系统

OpenClaw 是可自托管的个人 AI 助手与 Agent 运行时,2.0(官方版本号为 v2026.8.1)重点扩展了会话搜索、跨设备/云端执行、持久进度卡、交互式组件、凭据保护、自动化权限、记忆、MCP、插件和多端客户端。

https://github.com/openclaw/openclaw/releases/tag/v2026.8.1 ↗

https://openclaw.ai ↗

想快速试用,先看官方仓库的安装说明;正式安装可使用 npm 安装最新版本,或克隆仓库后按 pnpm workspace 流程安装并构建。第一次运行不要直接接入真实账号和高权限目录,先准备一个测试工作区,配置一个低权限模型和单独的 API 凭据,再让 Agent 完成“读 README、列出文件、生成测试计划”这类可回滚任务。重点体验会话进度、权限确认、MCP 连接和跨设备执行;升级到 v2026.8.1 前先备份配置与状态,并运行 doctor 检查迁移结果。

这不是单一聊天壳,而是在向 Agent 操作系统靠拢。官方更新同时覆盖模型路由、凭据隔离、会话记忆、工作板、MCP、插件信任、云端 Worker 和权限模式,说明竞争焦点已从“模型能不能回答”转为“能不能长期运行而且出了问题可追踪、可恢复”。不过版本变更面很大,OpenProse 和 OpenAI 路由均有迁移事项,不能把一次升级当成无风险更新。

原文链接
🛠️ OJO Design Skills:给 Coding Agent 加一套设计决策协议

OJO Design Skills 是面向 Codex、Claude Code、ZCode 等 Coding Agent 的开源 UI/UX skill 包,用设计方向、设计 token、组件规范、交互状态和反 AI-slop 规则约束页面产出。

https://github.com/touchine-ojo/OJO-Design-Skills ↗

https://ojo.art ↗

先在一个前端测试仓库里阅读 README 和 references,再用官方安装脚本按目标客户端安装;例如 Codex 可执行 `curl -fsSL https://raw.githubusercontent.com/touchine-ojo/OJO-Design-Skills/main/scripts/install.sh | bash -s -- --target codex --force`。安装后让 Agent 先对现有页面做设计审计,再要求它给出两到三个风格方向,选择一个方向后生成 token、组件和页面。最后用浏览器截图或实际交互逐项验收颜色、间距、空状态、错误态、移动端适配,不要把“装上 skill”误当成设计质量已经保证。

它的价值不在于再提供一套漂亮提示词,而在于把“凭感觉做页面”拆成可复用的判断步骤。仓库明确提供 Convention 和 Innovation 两条路线,并加入反渐变、真实图片、交互状态和 spring motion 等护栏,尝试把审美偏好转成 Agent 可读取的工程约束。项目规模仍小,适合当作实验性基线,不宜直接视为成熟企业设计系统。

原文链接
🛠️ DeepSeek-V4-Flash-Vision-Exp:把视觉输入接入 Agent API

这是 DeepSeek 的实验性多模态模型,除文本 Agent、推理和知识能力外,可接收图片并用于截图理解、图表分析、OCR 辅助和视觉 Agent 工作流。

https://api-docs.deepseek.com/news/news260821 ↗

https://api-docs.deepseek.com/guides/vision ↗

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp ↗

先在 DeepSeek API 文档申请密钥,使用官方模型名 `deepseek-v4-flash-vision-exp`,优先从 Vision 指南中的 OpenAI 兼容 Chat Completions 示例开始。准备一张不含隐私的截图或图表,用 URL、Base64 或 Files API 传入图片,再要求模型输出结构化 JSON,例如“识别表格列名、读取关键数值并标注不确定项”。随后接入一个只读工具,让 Agent 根据截图提出下一步操作但不自动执行。图片按最多 384 tokens 计费,模型仍标注为 experimental,生产使用要准备文本模型或传统 OCR 的回退路径。

官方文档给出的组合方式很实用:同一个模型同时支持混合文本+图片输入、Chat Completions、Messages 和 Responses,还能复用 Files API 中的图片。这样视觉理解不必再单独拼一个“图片描述器”,可以直接进入工具调用和任务规划。需要注意的是,官方能力宣称与实际业务准确率不是一回事,尤其是密集 OCR、小字截图和复杂图表,必须用自己的样本集验收。

原文链接
🛠️ Hyper3D WorldGen:从一张图走向可拆解的三维场景

Hyper3D 展示的 WorldGen 目标不是只生成一个孤立 3D 资产,而是从场景图片中重建多个独立物体、空间关系和物理约束;目前官方公开入口更明确的是 Hyper3D Rodin 的图生 3D/API,WorldGen 的具体开放范围仍需以官方页面为准。

https://hyper3d.ai/ ↗

https://developer.hyper3d.ai/ ↗

https://www.leiphone.com/category/ai/0H6Hce7AH5b0wRLZ.html ↗

先在 Hyper3D 官网注册,进入 Rodin 的 Image To 3D 工作区,用一张主体清晰、背景干净的物品照片生成 GLB/GLTF 等资产,观察网格、材质和可编辑性;如果需要自动化,再阅读 API 文档,按“提交任务—轮询状态—下载结果”的异步流程接入自己的脚本。对于 WorldGen 本身,先把 X 帖子中的场景案例当作能力演示,不要默认每个账号都能调用;可先用客厅、桌面或产品陈列图做人工评估,分别记录物体分离、遮挡补全、尺度关系和碰撞合理性。

如果生成结果真的包含独立 Mesh、场景布局和物理属性,3D 生成的价值就从“做一张好看的图”提高到“给仿真、游戏、XR 和空间设计提供可继续加工的世界”。Hyper3D 公开资料也显示 Rodin 已覆盖图生 3D、文本生 3D、API 和多种导出格式。当前最大的不确定性是 WorldGen 的公开可用性、稳定性和复杂场景误差,先把它当作值得实测的早期产品,不宜直接按宣传效果估算生产成本。

原文链接
🛠️ ColaMD 2.0:让人和 Agent 同时盯着 Markdown 工作

ColaMD 是开源、跨平台的 Agent Native Markdown 编辑器;Agent 修改打开的 `.md` 文件时,编辑器实时刷新,并提供所见即所得、Mermaid、任务列表、主题、PDF/HTML/Word 导出和多窗口等能力。

https://github.com/marswaveai/ColaMD ↗

https://colamd.com/ ↗

macOS、Windows 或 Linux 用户直接进入 GitHub Releases 下载对应安装包;也可以克隆仓库后按 README 执行 `npm install` 和 `npm run dev`。打开一个专门的 Markdown 项目目录,在 ColaMD 中载入文件,再让 Claude Code、Codex 或其他 Agent 修改同一个文档,观察实时同步和标题栏 Agent Activity Indicator。先用日报、会议记录或项目设计文档测试,再试 Mermaid、PDF/HTML/Word 导出;涉及重要文档时保留 Git,因为实时刷新解决的是观察问题,不等于替你做版本管理。

很多 Agent 工作流的痛点不是生成不出文字,而是人不知道 Agent 正在改什么、改完是否落盘、如何快速审阅。ColaMD 把 Markdown 当作内容层,把编辑器当作可视化协作面,既不要求迁移到云端,也不内置一个黑盒 AI。对经常让 Agent 改 README、方案、简历和知识库的人,这种“边写边看”的反馈环很直接;但项目仍在快速迭代,建议先在副本中使用。

原文链接
🛠️ Mole 1.13:macOS 上的清理、卸载与状态检查工具

Mole 是 macOS 开源 CLI,集清理缓存、卸载残留、磁盘分析、优化、项目产物清理和系统状态监控于一体;免费 CLI 与收费原生 Mac App 是两个产品形态。

https://github.com/tw93/Mole ↗

https://mole.fit/ ↗

在终端执行 `brew install mole` 安装稳定版,然后先运行 `mo --version` 和 `mo analyze` 了解当前磁盘情况。任何删除动作都先使用 `mo clean --dry-run`、`mo uninstall --dry-run` 或 `mo installer --dry-run` 查看候选路径,确认不会误删开发缓存、同步目录或业务文件后再执行;需要清理项目构建物可单独用 `mo purge`。如果偏好 GUI,可到 mole.fit 试用原生 Mac App,但要注意它和 GPL-3.0 的 CLI 不同,收费与许可规则也不同。

它与生成模型不是同一类工具,却正好补上本地 Agent 工作站的基础设施:模型下载、构建缓存、日志和旧安装包会持续吞噬磁盘,卸载软件还常常留下 LaunchAgent 和偏好文件。Mole 把清理前预览、残留关联和系统状态放在同一套工具里,尤其适合开发者机器。不过清理工具拥有删除能力,任何“可安全”判断都不能替代人工复核和备份。

原文链接
🛠️ Miya.fm:把 X 帖子或照片变成可分享的音乐视频

Miya.fm 是一个处于 Beta 的社交化 AI 音乐产品,官网提供 Playground;官方页面描述为把生活素材变成音乐,X List 用户实测的主要玩法是输入 X 帖子、个人页或图片生成带歌词的吐槽式歌曲/视频。

https://miya.fm/ ↗

https://miya.fm/playground ↗

打开官网进入 Playground,先用一条不含私人信息的公开 X 帖子或一张普通照片测试;根据页面提供的创作模式粘贴链接或上传素材,补充希望的情绪、吐槽角度或音乐方向,再提交生成。第一次建议只做短内容,记录生成等待时间、歌词是否误读原文、是否出现不适合公开的个人信息,以及成品能否下载/分享。官网当前标注 Beta 期间免费,并提示桌面端仍在准备中,因此不要把 X 账号授权、付费规则和长期可用性想当然,发布前先人工检查版权与隐私。

它把“音乐生成”从写提示词改成了社交内容再创作:用户不需要先懂曲风,只要提供一个已有素材,产品就把它转成歌曲和视频。这种入口更适合短视频、朋友互动和内容二创,也更容易形成传播。另一方面,引用真实人物帖子会带来肖像、隐私、诽谤和版权边界,产品越是低门槛,越需要在分享前做人工审核。

原文链接
🛠️ fal.live:尝试“观众提示词驱动”的实时互动直播

fal.live 是 fal 生态推出的互动 AI 直播网站,X 帖子描述的玩法是选择频道、输入接下来想发生的事情,然后观看内容实时生成;fal 官方开发平台同时提供统一的图像、视频、音频、音乐和实时模型 API。

https://fal.live/ ↗

https://docs.fal.ai/introduction ↗

打开 fal.live,先浏览公开频道,确认页面是否允许直接观看或需要登录;进入可交互频道后,用短而明确的提示测试,例如改变场景天气、镜头方向或下一段事件,不要一上来输入复杂长剧本。记录提示提交到画面变化之间的延迟、是否能连续保持角色/场景一致、互动次数限制和是否有内容过滤。开发者则先在 fal Sandbox 里比较模型,再按官方文档使用统一 API;任何面向公众的实时生成都要设置预算、速率限制、内容审核和超时回退。

它把生成式媒体从“一次生成一个文件”推进到“边看边影响剧情/画面”,产品形态更接近游戏、直播和互动叙事。fal 的统一模型入口降低了搭建实验的门槛,但实时场景的难点不只是模型质量,还包括延迟、状态保持、并发成本和不确定输出。当前 X 帖子对 fal.live 的具体频道和限制描述有限,适合亲自点开验证,不宜据此推断完整商业能力。

原文链接
📡 Uber 把 Agent Coding 做成可度量的软件工厂

Uber 官方工程文章披露,超过 70% 的 Pull Request 可归因于本地或云端 Agent,内部已建立 3600 多个 skills,每天执行超过 3 万次。

这条信息的价值不只在“70%”这个比例,而在于 Uber 同时公开了成本方程和度量方法:用户数、会话数、每会话轮数、每轮请求数、Token 数和单价共同决定 Agent 总成本。官方还把代码生成、验证、部署、观察和维护拆成层级,并建设包含数千万节点和边的上下文图。它说明大规模采用的瓶颈并不是再买一个更强模型,而是让 Agent 找得到上下文、能被验证、出了问题有人工升级路径。

企业软件开发会从采购单点 Copilot,转向建设内部上下文图、skill 注册表、评测集、权限边界和成本看板。对中小团队而言,不必复制 Uber 的规模,但可以先追踪每个 Agent 任务的成功率、返工次数、人工审查时间和单位成本;否则“提交量增加”很容易掩盖维护负担和低质量代码。

原文链接
📡 Gemini Notebook 改为按计算量滚动刷新使用额度

Google 官方公告称,Gemini Notebook 将采用与提示复杂度、对话长度、来源数量和所用功能相关的计算型额度,并从 2026-09-02 起向消费者 Web 和移动端逐步推出。

X 帖子把它概括成“五小时限制”,但官方原文的准确表述是额度每五小时刷新一次,且不同任务消耗并不相同;达到额度时,Video Overviews 或 Slide Decks 等输出可以延后生成,并支持通知。这个变化反映出长上下文、来源检索和多媒体生成的产品计费,正在从简单的“每天几次”转向按计算预算管理。用户体验可能更连续,但也更难凭一次任务直观预测还能用多少。

研究、教育和内容生产用户需要把“额度”纳入工作流设计,长报告可拆分、重输出可排队、素材数量要控制;产品方则必须把消耗原因、剩余额度和延后任务讲清楚,否则用户会把复杂度相关的限制理解成降级或变相涨价。对 Agent 产品来说,这也是按任务预算和优先级调度的先例。

原文链接
📡 Agent 速度不等于 tok/s:本地模型竞争转向“完成任务的效率”

X List 的本地实测比较显示,Qwen 与 GLM 在 token 速度和任务完成速度上可能出现相反结果;讨论焦点从单纯吞吐转向停止规则、返工次数和最终交付质量。

这只是社区实测线索,不是严格控制变量的基准测试,但它抓住了 Agent 场景的关键:模型每秒吐多少字,只能衡量生成速度,不能衡量它是否找对文件、是否反复修改、是否在任务已经完成后继续发散。对于带工具调用的任务,真正的总时延还包括规划、执行、测试、回滚和人工确认。因而本地部署评测应至少记录端到端完成时间、有效变更比例、测试通过率和超预算停止次数,而不是只看 tok/s。

模型厂商会更重视默认停止策略、工具调用稳定性和长任务控制;使用方也需要建立自己的任务集,比较“每个成功交付的成本”和“每小时有效产出”。这会削弱单一榜单的解释力:一个速度更快但经常过度加工的模型,未必比速度较慢但更克制、可预测的模型更适合生产。

原文链接

🎯 值得关注