🛠️ BrowserSkill:让 Agent 借用真实登录浏览器而不打断工作
一句话
腾讯开源的 BrowserSkill 由 bsk CLI/本地守护进程和浏览器扩展组成,让 Claude Code、Codex、Cursor、Hermes 等能调用用户已经登录的 Chromium 浏览器,在隔离的 Agent Window 中执行访问、点击和表单类任务。
怎么玩
先阅读官方 README 和 AGENT_INSTALL.md,再执行 `curl -fsSL https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.sh | sh` 安装 bsk CLI,随后运行 `bsk install-skill --yes` 把对应技能装进正在使用的 Agent。浏览器端还需要从 Chrome Web Store 安装并启用 BrowserSkill 扩展,最后用 `bsk doctor` 检查 CLI、守护进程和扩展连接状态。第一次建议做无副作用的只读任务:打开一个公开网页、提取标题和链接、保存页面快照;确认 Agent Window、用户窗口隔离和权限提示都符合预期后,再在测试账号中试填表。不要一开始就把支付、删帖或生产后台写操作交给它。
为什么值得关注
它把“浏览器自动化”从独立的无登录脚本推进到真实工作环境,但仍保留 Agent Window、CLI 路由和扩展连接等边界。对需要使用既有登录态的研究、后台运营和回归测试尤其有价值;同时,浏览器权限、页面提示注入和账号误操作风险也被暴露得更清楚,适合用来建立可审计的浏览器 Agent 安全基线。
应用场景
- 让 Agent 在已登录的测试账号中读取后台数据、整理结果并生成报告。
- 对 Web 产品做跨页面回归测试,保留页面快照、操作记录和最终状态。
🛠️ Termany:把多个编码 Agent、工作树与远程主机放进一个工作台
一句话
Termany 是本地优先、面向 Agent 的终端工作区,可在多个窗格并行运行 Claude、Codex、Gemini、OpenCode、Hermes 等会话,并集中查看文件、Git diff、工作树、SSH 主机、端口和用量。
怎么玩
最省事的入口是访问官网下载对应桌面版本;如果想研究实现,则克隆源码后按 README 的 Node/pnpm 与桌面构建说明启动。打开后先建立一个工作区,为两个互不影响的小任务各开一个 pane,例如一个 Agent 修复测试失败,另一个 Agent 只做文档更新;在侧栏观察 working、done、needs-attention 状态,再打开文件树和 Git diff 检查改动。随后可以给不同 pane 分配不同 worktree,尝试连接一台测试 SSH 主机并观察端口转发。模型提供商采用 BYOK,配置前先确认密钥保存在本机位置,不要把生产凭据放入项目文件或日志。
为什么值得关注
它不是单纯把终端标签页换了皮肤,而是把 Agent 的会话生命周期、工作树、远程环境、进程端口和 token 成本放到同一可观察面板。多 Agent 协作最容易丢失的正是“谁改了什么、跑在哪、是否还在工作、为何停住”,Termany 把这些运行态信息显式化,适合比较本地桌面 Agent 与云端工作区的管理差异。
应用场景
- 并行维护多个分支,让不同 Agent 分别编码、测试和做代码审查。
- 在本地 Mac 与远程开发机之间切换,集中查看会话、端口和 Git 状态。
🛠️ Confucius R2T2:为 Voice Agent 提供不回改的流式语音识别
一句话
网易有道开源的 Confucius R2T2 是面向实时语音交互的流式 ASR,核心 Stable Prefix 机制让已经提交给下游的转写前缀只增长、不随模型继续听音而反复回改。
怎么玩
先访问官网,用英文和中文的短音频分别启动实时回放,观察转写文本是如何逐步提交的,重点记录“已提交前缀”是否稳定、停顿后是否继续追加,以及出现口误时系统如何处理未提交部分。然后下载官网提供的代码和权重,在隔离的 Python 环境中按项目说明运行一个本地流式样例;准备一段包含数字、专有名词、停顿和自我更正的录音,把普通离线转写与 R2T2 的输出按时间戳对齐。接入自己的 Voice Agent 时,先让 ASR 只向下游发送稳定前缀,另存临时片段和最终结果,再逐步接入打断检测、工具调用和 TTS,不要直接让未经确认的中间文本触发不可逆业务动作。
为什么值得关注
实时语音 Agent 的瓶颈不只是首字延迟,还包括识别结果反复修改对对话状态机、工具参数和字幕显示造成的连锁影响。Stable Prefix 把“哪些文字可以安全交给下游”变成明确接口,有机会降低回滚和重复执行复杂度;不过真实噪声、多人对话、方言和长时间会话的稳定性仍应通过自己的音频集验证,不能只看官网回放。
应用场景
- 给客服、预约和语音控制 Agent 提供可增量消费的稳定转写。
- 实时生成会议字幕或语音笔记,区分临时识别结果与最终提交结果。
🛠️ Ling-3.0-flash-VL:让视觉模型直接参与理解、行动与验证
一句话
蚂蚁 inclusionAI 开源的 Ling-3.0-flash-VL 是原生多模态 MoE 模型,支持图像、视频和文本输入,官方资料称总参数约 124B、每 token 激活约 5.5B、上下文最长可扩展到 1M,并把视觉信息纳入理解、推理、规划、行动和验证流程。
怎么玩
这不是适合普通 Mac 直接下载的轻量模型,先在 Hugging Face 模型卡确认权重、许可证和硬件要求;官方推荐用 SGLang 容器部署,示例是拉取 `lmsysorg/sglang:dev-Ling-3.0-flash-VL`,在 4 张 141GB 级 GPU 上用 `--tp 4` 启动 256K 上下文服务,80GB 卡则参考官方的 `--tp 8` 方案。服务起来后用 OpenAI 兼容接口发送一张作业、发票或 UI 截图,要求模型同时返回目标区域坐标和文字解释,再让一个简单脚本根据坐标裁剪区域并二次核对。也可以用视频输入做短片段事件定位;测试时保存原图、请求参数、模型输出和人工标注,避免把模型卡中的厂商评测分数直接当成自己的效果。
为什么值得关注
它体现的是视觉输入从“看图问答”向 Agent 感知闭环移动:模型不仅描述内容,还要把视觉信息用于定位、决策、执行和结果检查。稀疏激活与长上下文的组合,对长文档、视频和多步骤任务具有吸引力;但模型规模和部署硬件门槛很高,且官方页面的 Artificial Analysis 指标属于模型方引用的结果,独立复现仍是判断其性价比的必要条件。
应用场景
- 自动定位作业错题、票据字段、网页控件或质检缺陷,再交给后续程序处理。
- 对短视频、屏幕录制和多页文档做带坐标或时间段的结构化检索。
🛠️ Devframe:一次定义开发者工具,多处运行并服务 Agent
一句话
Anthony Fu 发布的 Devframe 是一个框架无关的开发者工具基础设施,目标是让同一个 devtool 定义同时以 Vite 插件、独立 CLI、静态报告、Web 界面和 MCP Server 等形式运行。
怎么玩
先克隆仓库并阅读 README、examples 和文档,安装项目要求的 Node.js/pnpm 依赖;不要一开始改造复杂插件,先做一个最小工具定义,例如读取项目配置并输出一份诊断结果。把它分别挂到独立 CLI、一个本地开发服务器和静态报告入口,确认共享状态、RPC 和错误信息在不同宿主中一致;再按官方 MCP 连接方式把只读诊断能力暴露给一个 Agent,让 Agent 查询结果而不是直接写文件。对现有 Vite/Nuxt 工具,可以先从 adapter 或示例 host 复制一个最小集成,记录启动时间、构建产物、MCP 调用日志和浏览器端显示是否一致。
为什么值得关注
开发者工具过去常被绑定在某个框架、构建器或开发服务器 API 上,迁移到另一个宿主往往要重复写集成层。Devframe 用 Web Standard Request/Response、共享 Hub 和可选 MCP 面把“工具定义”和“宿主接入”拆开,既服务人类开发者,也服务 AI Coding;这条路线可能让诊断、检查器和可观测性工具形成可组合生态,但 API 稳定性与真实第三方采用还需要继续观察。
应用场景
- 把同一套项目诊断能力同时发布为 CLI、IDE/开发服务器面板和 Agent 工具。
- 为团队内部工具建立统一的状态、RPC、报告和权限边界,减少多端重复开发。
🛠️ 网易叭哥说:把自然口述整理成可直接使用的结构化文字
一句话
网易有道的叭哥说是桌面端 AI 语音输入 Agent,官方定位是把连续自然语音转换为清晰、准确、结构化的文字,支持去口头禅、自动标点、智能分段、专业词库、多语种翻译和跨应用输入。
怎么玩
访问官网选择 Mac 或 Windows 版本安装,第一次先在一个不会误发消息的文本编辑器里试用。按住输入入口,连续口述一段包含改口、重复、专业术语和中英混输的工作内容,观察它如何去掉“呃”“然后”等口头禅、补标点并分段;随后在设置中建立一个只包含自己常用框架名、API 名和产品名的词库,重新口述同一段文本比较识别差异。再测试跨应用粘贴到 Markdown 编辑器、邮件草稿和终端输入框,核对最终文字而不是只听识别过程。官网声称语音和文本数据的处理方式有隐私保护说明,使用前仍应逐项阅读;涉及客户资料、密码或内部机密时先做脱敏测试。
为什么值得关注
它与普通“语音转文字”的差别在于把后处理、意图理解和可直接复用的排版放到输入链路中,目标是让人说出来的内容更接近可发送、可提交的结果。对开发者和高频写作者而言,专业热词、口语清洗和跨应用输入比单纯提高识别率更影响实际效率;不过免费策略、云端依赖和隐私承诺都应以当前官方页面为准,不能只依据社交平台的替代推荐。
应用场景
- 口述会议纪要、需求说明、邮件和聊天回复,减少整理与校对时间。
- 直接口述 README、Commit Message、代码注释或多语种草稿。
🛠️ Memoh:给每个 Agent 一个持续在线的隔离工作空间
一句话
Memoh 是开源、容器化的多 Agent 平台,为每个 Agent 提供独立文件系统、桌面、浏览器、网络和长期记忆,可自托管并承载 Claude Code、Codex 等外部编码 Agent。
怎么玩
先确认本机有 Docker 与 Docker Compose,再按 README 克隆仓库:`git clone --depth 1 --recurse-submodules --shallow-submodules https://github.com/memohai/Memoh.git`,进入目录复制 `conf/app.docker.toml` 为 `config.toml`,逐项填写模型、渠道和存储配置后用 Compose 启动。第一次只创建一个测试 bot,给它一个单独的工作目录和低权限 API Key,通过 Web UI 或 Telegram 等已配置渠道让它完成“读取一份公开文档、生成摘要、保存文件”的任务。检查容器边界、长期记忆是否跨会话保留、MCP 调用是否有独立配置,以及任务停止后文件和日志是否仍可回溯;确认隔离有效后再增加第二个 bot,不要把宿主机敏感目录直接挂载进去。
为什么值得关注
许多 Agent 工具默认把状态、文件和浏览器放在用户当前机器上,长期运行、多用户协作和权限隔离很快会变成运维问题。Memoh 把“每个 Agent 一台电脑”的抽象落到容器、持久记忆、渠道和 MCP 上,适合探索后台任务与个人助理的持续性;但它是 AGPLv3 项目,部署时还要认真评估容器网络、密钥存储、镜像更新和多租户边界。
应用场景
- 为不同项目或家庭成员部署彼此隔离、持续在线的 Agent。
- 在服务器上托管编码 Agent,让它们定时执行任务并通过消息渠道回报结果。
🛠️ Dream-RSI:把 Agent 的历史探索树变成低成本策略模拟器
一句话
Google、Google DeepMind 与学术机构提出的 Dream-RSI 通过记录 Agent 的探索决策和执行结果,把已经走过的发现树当作精确的回放模拟器,在不重复真实执行的情况下评估和改进探索策略。
怎么玩
先读论文中的三阶段流程:在线探索、构建回放模拟器、在历史世界中进行策略改进。然后克隆代码,按仓库说明准备一个小型、可重复的算法或代码搜索任务,限制并行度和预算,先跑出一棵带节点结果的探索树。不要直接在生产 Agent 上开启自我修改;可以把“选择下一分支、何时停止、并行多少任务”抽成独立策略,在本地回放同一棵树,比较固定策略和候选策略的覆盖率、成本估计与最终得分。最后只把回放得分更好的策略提交给一次新的在线试验,并记录离线分数与真实结果的差异,因为回放只能覆盖历史已经探索过的区域。
为什么值得关注
Agent 自我改进通常受制于真实执行昂贵、反馈延迟和长程任务难以重复。Dream-RSI 的关键不是训练一个幻想世界模型,而是重新解释已经付费得到的探索记录:在已实现的搜索空间内,替代策略可以直接读取历史结果,从而低成本比较分支顺序、并发和停止规则。它给 Agent Harness 的优化提供了比“继续堆提示词”更可测的接口,但也有清晰边界:历史没走过的区域无法被回放,离线最优不保证在线泛化。
应用场景
- 优化代码搜索、算法发现或 GPU Kernel 探索中的分支选择与停止策略。
- 为长程 Agent 建立“历史轨迹—离线评估—小规模线上复验”的实验闭环。
📡 Anthropic 把 Claude Cowork 与日常聊天合并为一个入口
事件
Anthropic 宣布把 Claude Cowork 和普通 Chat 合并为一个 Claude,Pro 和 Max 用户开始分批获得更新,复杂任务可以在同一对话中继续执行并在后台运行。
解读
这次变化的重点不是换一个按钮,而是把“先判断该用聊天还是 Agent 模式”的产品决策交给模型。官方说明显示,文件、项目、连接器、技能、浏览器和计算机使用等能力逐步从 Cowork 入口扩展到普通会话,用户可以先问一个问题,再把同一上下文交给 Claude 继续做报告、表格或演示文稿。对用户来说,入口变简单了;对平台来说,权限、上下文、后台任务、成本和失败恢复都必须在一个统一状态机里工作。更新仍是渐进式推送,同一套餐不一定同时看到新界面,不能把社交平台截图当作所有账号已可用的证明。
影响评估
Agent 产品会从“模式选择器”转向“统一工作空间”,竞争焦点也会从单轮回答质量转向任务是否能持续、文件是否可编辑、浏览器动作是否可审计以及用户能否随时接管。企业采用时需要重新检查后台执行权限、文件夹信任范围、数据留存和管理员通知机制;个人用户则应先用低风险报告任务体验资源消耗和结果复核流程。
📡 DeepMind Institute:前沿实验室开始把 AGI 讨论机构化为跨学科出版平台
事件
Google DeepMind 成立 DeepMind Institute,由 Shane Legg、James Manyika 和 Demis Hassabis 等担任负责人,发布关于 AGI 安全、推理透明度、经济政策和社会影响的跨学科文章;官方明确声明文章不代表 Google 官方立场。
解读
DMI 不是新的模型 API,也不是监管机构,而是把原本散落在论文、演讲和社交平台上的 AGI 议题,放入一个长期维护、允许观点变化和争论的出版平台。首批内容既讨论推理透明度如何帮助安全审计,也讨论 AGI 可能造成的经济冲击与政策选择,说明前沿实验室正在把“能力发布”之外的制度、劳动力和治理问题纳入产品叙事。需要区分机构身份与公司立场:官网说它是 DeepMind、Google 及全球研究社区的思想平台,文章可以提供研究线索,但不等同于 Google 的承诺或政策决定。
影响评估
未来 AI 公司的影响力竞争可能不只体现在模型榜单,还体现在能否形成被研究者、政策制定者和产业界共同引用的议题框架。对企业和开发者而言,推理透明度、模型治理和经济影响不再只是合规部门的附加问题,而会影响采购、部署与组织设计;对读者而言,应同时保留作者立场、证据来源和官方免责声明,避免把思想文章误读成产品路线图。
📡 Perplexity 用 CobbleDB 重写 AI 搜索存储层,展示 Agent 辅助基础设施开发的边界
事件
Perplexity 官方介绍了由 CobbleDB、Pillar、Lorry 组成的新存储链路,用于服务经过处理的网页记录;官方称批量读取延迟约降低 5 倍、成本估算至少降低 20%,并披露核心 Rust 数据库约 4 万行、由两名工程师和大量编码 Agent 协作完成。
解读
真正值得关注的是架构分工和责任边界,而不是“几百个 Agent 写了数据库”这句传播性很强的标题。Pillar 负责持久文档状态和发布,Lorry 把更新整理成按分区的批次,CobbleDB 则专注于查询时的热存储和批量读取;数据面与控制面分离后,慢节点可以独立追赶。Perplexity 的官方文章同时强调,Agent 负责持续检查、实现和测试,但生产架构、审查与授权仍由工程师掌控。外部报道还提醒,前后延迟对比是生产迁移数据而非严格受控基准,维护自研数据库的长期成本也未包含在简单节省估算中。
影响评估
AI 搜索、RAG 和实时检索系统会更愿意为自己的访问模式定制存储,而不是把通用数据库默认当成唯一答案;Agent 则可能把基础设施试错的日历时间压缩到更短。但这不意味着团队可以取消数据库专家或生产授权,恰恰相反,越多代码由 Agent 生成,就越需要架构约束、故障注入、数据一致性验证、回滚方案和明确的人工责任。对中小团队,先在热路径做窄用途组件和可回退旁路实验,比直接重写核心存储更稳妥。
📡 Reward AI 发布 OM-1,试图用纯人类动作数据跨机器人形态学习
事件
Reward AI 公布通用机器人策略 OM-1,宣称通过带传感器的可穿戴手部设备采集自然人类操作数据,不使用遥操作或真机预采集数据,并希望让同一策略适配桌面机械臂、工业机械臂、移动操作平台和人形机器人。
解读
OM-1 的路线把数据采集、策略学习和低层控制拆成两个层次:上层模型从统一的人类示范接口学习动作决策,底层高频控制器再处理具体机器人的动力学、延迟和外部扰动。这个设计解释了为什么团队可以提出“One Model, One Data Interface, Any Body”的目标,也解释了为什么不能只看演示视频判断泛化能力。当前公开信息主要是公司演示和产品叙事,可信报道明确指出尚无论文、权重、代码、数据集、完整成功率、公开基线或可购买 API;“少于 30 分钟学会新任务”等数字应按公司声明处理。
影响评估
如果后续基准和真实部署能够复现,机器人数据接口可能从“每种机型单独采集”转向更通用的人类示范层,降低新硬件进入训练管线的成本;如果不能复现,则它仍只是值得跟踪的研究方向。产业方在评估类似方案时应优先索要跨形态成功率、失败类型、长时任务、碰撞安全和恢复策略,而不是把正常速度的精选视频当作生产可用性证明。