🛠️ Termany:把多个编码 Agent、终端、工作树和远程主机放在一扇窗口里
一句话
一个本地优先的 Agent 原生终端,可并排运行 Claude、Codex、Gemini、OpenCode、Hermes 等会话,并在同一界面查看文件、Git diff、会话状态、端口、SSH 主机与用量。
怎么玩
先打开官网下载安装桌面版,或按仓库 README 从源码运行;启动后在 Settings → Agents 中点击 Detect,让它探测本机已有的 Claude、Codex、Gemini 等命令。新建一个 workspace,把同一项目按页面、标签页和 pane 拆开,在不同 pane 分别启动编码 Agent;用 ⌘D/⇧⌘D 分屏,用文件视图或 Git diff 检查改动,用 Activity Monitor 看 CPU、内存和端口。若有开发机,可给每个 pane 配置 SSH,先测试连接,再把长任务放到远端,最后通过状态标签定位需要你处理的会话。
为什么值得关注
它把“多 Agent 并行”从几个终端窗口的手工管理,提升为可观察的工作空间问题。working、done、needs attention 等状态让后台任务具备可见性,工作树、端口和远程连接又把真正容易失控的工程上下文放回同一界面。仓库采用 AGPL-3.0,适合先试用再评估团队部署和二次修改的许可边界。
应用场景
- 同一代码库并行跑功能开发、测试修复和代码审查,并快速比较各自 diff。
- 将需要长时间运行的 Agent 放到 SSH 开发机,避免笔记本休眠后丢失上下文。
🛠️ pstack:把 Cursor 变成强调验证和多模型分工的工程团队
一句话
Cursor 官方插件,提供 poteto-mode 及一组工程 Skills/Playbooks,用于把复杂编码任务拆成调查、架构、TDD、评审、去脏和验证等可重复步骤。
怎么玩
在 Cursor 中执行 `/add-plugin pstack`,安装后先运行 `/setup-pstack` 选择可用模型,再用 `/poteto-mode` 描述目标和验收方式,而不是只说“帮我改代码”。例如明确写“先复现重复行问题,再修复,并用测试证明重试不会再次插入”;让模式自动选择调查、bug fix、TDD、review 等 playbook。完成后打开对应 diff、测试结果和工作记录,检查 Agent 是否真的复现了问题、是否验证了边界条件;复杂任务可以在多个 worktree 中并行,但每条分支都要保留可回放的证据。
为什么值得关注
它把“模型能力”与“工程流程能力”分开处理。仓库 README 明确强调少写但写得更高质量,并通过不同模型承担精确代码、机械执行和判断任务;这比单纯追求 token、代码行数或一次性大生成更接近真实生产研发。注意它是 Cursor 插件生态,不是通用 CLI,且部分技能依赖 cursor-team-kit。
应用场景
- 对关键 PR 强制加入复现、设计推演、测试和审查环节,降低 Agent 代码的返工率。
- 给夜间自动化任务配置明确的验收条件,早晨优先检查有证据的失败点。
🛠️ LottieFiles Motion Design Skill:让编码 Agent 先理解动效意图,再写动画代码
一句话
LottieFiles 开源的通用动效设计 Skill,把时序、缓动、编排、情绪和 Disney 动画原则整理成可供 Agent 使用的设计知识,且不绑定 CSS、Framer Motion、GSAP 或 Lottie。
怎么玩
在项目或个人 Skills 环境执行 `npx skills add LottieFiles/motion-design-skill`,然后让 Claude Code、Cursor、Codex 或其他兼容 Agent 先阅读该 Skill,再提出具体任务,例如“为表单按钮设计 loading→success→error 的状态过渡”或“让卡片按主次关系依次进入”。让 Agent 先写出动效人格、触发条件、持续时间、缓动、元素顺序和无障碍降级方案,再生成实现代码;完成后在浏览器中检查快速重复点击、低性能设备、prefers-reduced-motion 和移动端触控,避免只看静态截图就宣称完成。
为什么值得关注
它把动效从“凭感觉加几个 transition”变成了可复用的设计决策层。仓库采用 MIT 许可,包含核心清单、动效哲学、常见模式和质量检查表,官方说明支持 40 多种 Agent。对 AI 生成前端尤其有价值,因为模型常能写出能运行的动画,却容易忽略节奏、层级、情绪和减少动态效果等体验约束。
应用场景
- 让 Agent 为后台、表单和数据加载状态生成统一的品牌动效规范。
- 在代码审查中检查动画是否过度、是否破坏可访问性和性能,而不是只检查语法。
🛠️ Heeler:用 iPhone 远程查看和接管运行中的编码 Agent
一句话
面向 herdr 的原生 iOS Agent 控制台,通过 SSH、真实终端渲染、QR 配对和推送通知,让你在手机上查看并操控电脑或服务器上的编码 Agent。
怎么玩
先在 iPhone 上从 App Store 或 TestFlight 安装 Heeler;在运行 herdr 的 Mac/Linux 主机上确保 Node >=20、herdr >=0.7.5,并开启 OpenSSH Remote Login,然后按仓库说明安装插件并执行 `herdr plugin action invoke heeler.pair`。用 Heeler 扫描终端弹出的配对二维码,确认主机指纹和 SSH 授权;连接后从状态排序的列表打开某个 Agent,阅读 live terminal,在 Composer 中编辑完整提示词后一次发送,也可以用工具键盘发送 Esc、Tab、方向键和 Enter。先用无副作用任务测试接管,再把推送通知、权限和 Jump Host 配置纳入自己的安全边界。
为什么值得关注
它解决的是 Agent 自动化之后非常实际的“人在哪里接管”问题,而不是再造一个聊天框。仓库使用 SwiftUI、libghostty 和 Metal 终端渲染,配对密钥放在 iOS Keychain,通知采用端到端加密设计;Agent 被阻塞或完成时,用户无需守在终端旁。iPad 支持仍在规划,且必须有可用的 herdr 主机与 SSH 环境。
应用场景
- 在通勤或会议间隙处理需要确认的编码 Agent,而不必打开电脑恢复终端。
- 统一查看多台开发机上处于 Blocked、Working 或 Done 状态的任务。
🛠️ Claude Tag + oncall-kit:把 CI/CD 值班做成可读、可审、人工决策的 Agent 流程
一句话
Claude Tag 将 Claude 放入 Slack 频道并连接组织工具;Anthropic 的 oncall-kit 则提供从事故历史生成分诊手册、只读诊断、人工批准和复盘学习的参考实现。
怎么玩
如果组织拥有 Claude Team 或 Enterprise,先由组织 Owner 在 Claude Tag 管理设置中配置身份、Slack 频道、GitHub 和只读监控连接,再把 `@Claude` 邀请进试点事故频道。可直接从 oncall-kit 仓库开始:克隆项目,用 `test-fixtures/RUNBOOK.md` 在虚构历史上跑一遍,理解 STACK、playbook、lessons 和人工 gates;迁移到真实环境时,先只授予日志、指标和仓库读取权限,让 Claude 输出带证据链接的初步诊断。把修复、回滚和发布明确留给人或受控审批,等验证指标恢复后再让 Agent 记录经验,不能把演示流程直接接到生产写权限。
为什么值得关注
Anthropic 官方案例称 Claude Tag 在其 CI 事故中通常能在 15 分钟内给出第一份分析;参考 kit 又明确规定 Claude 负责收集证据、提出方案、验证和沟通,人类负责决定缓解与部署。它展示了企业 Agent 更可信的落地方式:工具访问有边界,结论有链接,动作有审批,学习内容进入可审查的 Git 文件,而不是藏在不可见的长期记忆里。oncall-kit 本身是参考代码,仓库注明不维护、不接受贡献,部署前应自行审查。
应用场景
- 对 CI 失败、特性开关和合并队列异常进行自动初筛,并把证据贴回事故频道。
- 把历史事故沉淀为可版本控制的分诊手册,缩短新成员值班时的定位时间。
🛠️ YouWare 3D 全球电台:一个可以立即打开的 Vibe Coding 成品体验
一句话
由 YouWare 生成并上线的 3D 网络收音机体验,支持全球电台、随机播放、收藏和交互式界面,适合直接观察自然语言生成的产品完成度。
怎么玩
直接打开 `radio.youware.app`,先允许页面加载资源,再尝试随机切换电台、搜索或分类浏览,旋转 3D 收音机并调整音量,记录加载速度、音频可用性和移动端触控体验。想复刻时进入 YouWare,先用一句话描述产品目标,再补充电台数据源、播放/暂停、收藏、主题、响应式布局和错误状态;生成第一版后逐项要求它修复交互,而不是一次塞入所有细节。YouWare 官方平台支持从文本或多模态输入生成网站、应用和游戏,也支持继续编辑与部署;不要把体验页的宣传效果等同于可维护的生产代码。
为什么值得关注
它的价值不只在“做了一个好看的收音机”,而在于把 AI 生成从静态 landing page 推到了可点击、可播放、带状态和数据源的完整小产品。对产品经理或开发者来说,直接拆解一个成品比看宣传截图更容易发现 Agent 在状态管理、第三方数据、异常处理和移动适配上的真实边界;同时也能快速验证一个交互概念是否值得继续投入。
应用场景
- 用作 Vibe Coding 的端到端样板,测试从需求描述到部署成品的时间和缺陷。
- 为活动页、互动展览、内容导航和个人作品集快速制作可用原型。
🛠️ Grok Bot 本地出口路由:让云端 Agent 的部分请求经过本机网络
一句话
Grok Bot 文档中出现的 beta 能力,可在 Bot 的云端电脑之外,让部分网络流量经过成员自己的电脑出口,以应对数据中心 IP 被目标站点拦截的情况。
怎么玩
先阅读 Grok Bot 的团队文档、网络策略和安全 FAQ,确认你的账号或组织确实显示该 beta 设置;在没有敏感凭据的测试 Bot 上创建最小任务,先访问一个你自己控制的回显服务,比较默认云端出口和本地出口看到的 IP,再测试目标站点是否仍需要登录或人工验证。企业环境要同时检查 Network Controls、MCP 连接器、Team Setup 和审计要求;不要因为“流量经过本机”就认为云端 Bot 获得了本地全部权限,也不要把生产内网、支付和个人浏览器会话直接暴露给测试任务。
为什么值得关注
它把 Agent 的“能不能访问某个网站”从模型能力问题变成了网络身份与信任边界问题。官方文档确认云端电脑使用共享静态出口,而自有网络客户端、Tailscale 或 Cloudflare Tunnel 等路径需要单独规划;本地出口路由可以减少数据中心 IP 被拦截,但也增加了本机网络审计、权限、数据泄露和责任归属的复杂度。适合做小范围网络实验,不适合未经审批的绕过控制。
应用场景
- 访问只允许家庭/办公网络出口的测试服务或内部开发环境。
- 验证云端 Browser Agent 在不同出口 IP、Cookie 和企业网络策略下的行为差异。
🛠️ Puul.ai:面向 AI 芯片设计的 RTL 数据与可验证训练环境
一句话
一个专门面向芯片设计 AI 实验室的数据服务,覆盖 Verilog、VHDL、SystemVerilog、完整项目上下文以及通过编译、仿真、综合等 EDA 流程验证的 RL 任务。
怎么玩
先在官网按芯片类型浏览资料,区分 RTL 代码、测试平台、约束、Makefile、综合脚本和 RL 环境,不要只看“代码库数量”这一宣传指标。若你在做 RTL 生成、验证或 PPA 研究,可先明确目标任务、语言、芯片类别、许可方式和所需 EDA 工具,再向服务方申请样本或报价;拿到样本后,用 Verilator/Yosys/仿真流程独立复核 manifest、许可证、可编译性和 reward 计算方式。个人研究者没有预算时,可把官网描述当作数据产品需求清单,再用公开 RTL 数据集搭建小规模对照实验,不能把 Puul 的商业数据当作已公开下载资源。
为什么值得关注
AI for EDA 的瓶颈往往不是再换一个通用模型,而是训练样本是否包含完整工程上下文、结果是否可执行验证、许可证是否清楚。Puul 把编译、仿真、综合、面积、功耗、时序和覆盖率等信号放进数据产品叙事,代表芯片 Agent 正从“生成一段 Verilog”走向“生成后必须通过硬件行为检查”。不过官网披露的规模和客户信息主要是供应方自述,仍需采购审查、抽样复现与知识产权核验。
应用场景
- 构建 RTL 生成、修复、验证和优化的训练/评测数据管线。
- 为芯片设计 Agent 设计可重复的编译、仿真、综合和 reward gate。
📡 OM-1:机器人基础模型开始强调“一套人类数据接口,适配多种机体”
事件
Reward AI 发布 OM-1,推文称其从人类操作数据学习,不依赖遥操作或特定机器人数据,并面向机械臂、工业机器人和人形机器人部署。
解读
这条线索的真正变化在数据接口,而不只是模型名字。传统机器人策略经常被采集设备、机器人形态和场景绑定,换一台机械臂就要重新收集或微调;OM-1 的叙事是先把人的动作变成统一输入,再让同一策略适配不同身体。外部技术报道同时指出,目前没有公开权重、代码、数据集或 API,公开材料也缺少可复现实验的成功率和统一基准,因此应把它看成有清晰路线的产品/研究演示,而不是今天就能下载的开源模型。
影响评估
如果这种“人类示范→通用动作策略→多机体控制”的接口最终能在公开基准上成立,机器人数据采集和跨硬件迁移的成本结构可能改变,硬件厂商也会更重视传感器接口和控制抽象层。但在安全关键动作、长时序任务、失败恢复和不同身体动力学上,演示视频无法替代系统评测;短期更值得跟踪是否发布论文、权重、数据格式和跨平台成功率。
📡 Agent 评测从“会不会做”转向“能做多久、值多少钱、是否可信”
事件
X List 中的课程解读把 METR、GDPval、DeepScholar-Bench 等工作归纳为智能体评测的时长、价值和可信度三要素。
解读
当 Agent 从一次问答变成数小时甚至数天的工作,单一 pass rate 很难说明真实生产力。短任务答对,可能不代表它能保持上下文、管理工具、处理失败、交付可用结果;反过来,完成任务也不代表经济价值足够,更不代表过程可审计。把时长、价值和可信度分开,有助于企业建立更接近实际的验收:任务是否完成、节省了多少人时、错误是否可追责、关键动作是否需要人工批准,以及 Agent 是否能在环境变化后稳定恢复。
影响评估
评测供应商和企业采购会逐步从“模型榜单第一”转向任务集、成本、延迟、人工接管率和回滚能力。对开发团队而言,长时程任务需要持久状态、检查点、幂等操作和证据日志;对使用者而言,选择工具时要问清楚失败如何暴露、结果如何验证,而不是只看演示成功率。这个方向也会推动编码 Agent、研究 Agent 和业务自动化采用不同的基准,避免用一个分数覆盖全部能力。