🛠️ Firecrawl Developer Index
一句话
面向 coding agent 的开发者资料检索索引,专门搜索 README、Issue、已合并 PR、OpenAPI 规格和精选技术文档,让 Agent 尽量从一手工程材料回答问题。
怎么玩
先打开官方文档确认 Developer Index 的能力边界,再执行 `npx -y firecrawl-cli@latest setup developer-index` 安装对应 CLI/Skill;也可以全局安装 `npm install -g firecrawl-cli` 后运行 `firecrawl developer "如何排查某个库的 429 重试问题" --limit 10`。第一次使用时按终端提示完成浏览器登录或配置 API Key,然后把自然语言问题直接交给索引。建议先用 `--dry` 或低频查询熟悉返回结构,重点检查结果类型、仓库名、稳定 ID 和 matched passages,再把具体 Issue/PR 链接交给 Claude Code、Codex 或 Cursor 做实现,不要只复制摘要。
为什么值得关注
它不是泛网页搜索,而是把“问题在哪里被报告、哪个 PR 修过、README 怎样定义 API”作为检索对象;结果带有类型、稳定 ID 和匹配段落,能明显减少 coding agent 依据博客或搜索片段猜 API 行为的概率。官方页面还支持按仓库、结果类型、语言、许可证和 stars 等条件收窄,适合把检索变成可审计的工程步骤。
应用场景
- Agent 遇到版本兼容、错误码或 API 行为问题时,先查对应 Issue/PR,再生成补丁。
- 团队把 README、OpenAPI 和已合并修复作为内部知识入口,构建可追溯的代码问答流程。
🛠️ DeepSeek-V4-Flash-Vision-Exp
一句话
DeepSeek API 上线的实验性多模态模型,在保留 V4-Flash 文本、推理和 Agent 能力的同时接收图片,可用于截图、图表和界面驱动的 Agent 工作流。
怎么玩
先在 DeepSeek API 平台准备密钥,使用 OpenAI 兼容客户端把模型名设为 `deepseek-v4-flash-vision-exp`;在一次 user 请求中同时放入文字和图片块,图片可以是公开 URL、Base64 data URL,或先经 Files API 上传后使用 file_id。第一轮建议拿产品截图、后台图表或网页错误页面做小样本测试,分别比较纯文本 V4-Flash 与 Vision-Exp 的识别、工具调用和成本;确认格式、图片大小、响应延迟和 token 账单后,再接入自动化流程。它明确是实验版本,生产使用要保留文本模型回退路径。
为什么值得关注
这不是把图片先交给独立 OCR 再拼回文本,而是把视觉输入直接纳入 DeepSeek 的 API、Responses 和 Messages 工作流;官方文档给出了支持格式、大小、请求体、图片数量和计费规则,开发者可以直接做可重复的 Agent 实验。对需要读屏、看图表或理解设计稿的 coding/computer-use 场景,接入门槛比另起视觉流水线低。
应用场景
- 让代码 Agent 读取截图、构建日志图表或 UI 草图,再生成修复方案。
- 用图片作为任务上下文,让自动化助手检查仪表盘、表单和多模态文档。
🛠️ NVIDIA Molt
一句话
NVIDIA NeMo 发布的、以 Agent 为中心的 PyTorch 原生强化学习研究框架,把 Ray 异步队列、vLLM rollout 与 NVIDIA AutoModel/FSDP2 训练组合成较小且可读的研究栈。
怎么玩
准备 Linux + NVIDIA CUDA 机器后,先 `git clone https://github.com/NVIDIA-NeMo/labs-molt.git && cd labs-molt`,优先按仓库推荐的项目容器启动完整依赖,再阅读 quick-start 脚本。把自己的环境写成 `Env.step()` 或把已有 Agent 包装成 `ChatAgent.run()`,在 Python 中返回 reward,然后从仓库示例复制一个 SFT/RL 命令做单机小规模 smoke test。调试时先降低 rollout、batch 和上下文长度,确认 Ray、vLLM 和权重同步都能工作,再扩大到多 GPU。只有 Mac 或没有 NVIDIA GPU 时,不要假装能跑训练;可以先读 README、论文和 agent contract,真正训练留给 CUDA 主机。
为什么值得关注
它把 reward 写成普通 Python、把 Agent 当作程序,而不是要求研究者穿过庞杂的 trainer/rollout 胶水层;仓库明确支持多轮工具、VLM 环境、异步 rollout 以及 TP/EP/CP。约 9.2K 行 RL 代码的“小而可读”取向,对需要频繁修改环境、估计器和训练循环的研究团队尤其有吸引力。
应用场景
- 为多轮工具使用、VLM 操作或 LLM-as-judge 环境编写自定义奖励并训练 Agent。
- 在保持 vLLM rollout 的同时研究异步 RL、MoE 和模型并行策略。
🛠️ ELI5 Claude Skill
一句话
Anthropic 社区插件市场中的一个极简 Skill,用 `/eli5` 把复杂主题解释成面向完全新手的 HTML 页面、大图和少量文字。
怎么玩
在已安装 Claude Code 的终端中执行 `claude plugin marketplace add anthropics/claude-plugins-community`,再执行 `claude plugin install eli5@claude-community`;也可以在 Claude Code 的插件界面完成同样操作。重启或重新进入会话后,用 `/eli5 什么是向量数据库`、`/eli5 解释这段代码` 这类短命令测试,检查输出是否真的生成可阅读的 HTML 解释。它本质上是一个很短的提示词 Skill,不需要为了偶尔一次解释专门安装;高频使用时再把它纳入团队的学习或 onboarding 流程,并先审阅插件来源和权限。
为什么值得关注
它的价值不在复杂代码,而在把“解释给不同认知水平的人听”固化成可复用入口;官方仓库明确给出了 Skill 内容,社区市场也有审核和固定版本的分发机制。对内部文档、代码评审和新成员培训来说,HTML 输出比一大段聊天文字更容易分享、复看和逐步改写。
应用场景
- 把陌生的代码、协议或论文概念转换成新人能读的可视化说明。
- 让技术团队快速生成培训草稿,再由专家校对术语和事实。
🛠️ Is Agentic
一句话
一个面向公开网站的 Agent 可用性评估工具,检查机器能否发现、访问、理解和使用页面,并给出带证据的报告与改进建议。
怎么玩
打开 is-agentic.com,把自己的网站、产品落地页或开发者文档 URL 输入扫描框,等待报告生成;先看 Essential 检查项,再看是否适用的 API、OAuth、MCP、开发者门户或交易流程检查。逐条打开失败项的证据,不要只盯着总分;优先修正服务端可见内容、HTTP 行为、文档结构、错误恢复和控件可操作性。修复后重新扫描同一个 URL,并把报告页面、JSON API 或只读 MCP 输出保存到 CI/发布检查中。注意它是一次公开快照,不是安全、无障碍或业务质量认证。
为什么值得关注
它把“网站是否对 Agent 友好”从口号变成了可复查的工程检查,报告同时提供观察到的 Agent journey、证据和建议,且公开页面不依赖客户端 JavaScript 才能被读取。对正在做 AI-native 产品的团队,先解决机器无法发现和理解信息的问题,通常比盲目增加一个聊天框更有实际价值。
应用场景
- 发布 API、文档站或 SaaS 官网前,检查 Agent 能否完成真实入口和错误恢复。
- 把 Agent 可读性纳入网站重构、文档治理和持续发布验收。
🛠️ Cursor Team Kit
一句话
Cursor 官方验证的团队工程插件包,覆盖 CI 观察、编译检查、代码清理、测试可靠性、工作总结和严格的可维护性审查。
怎么玩
在 Cursor Marketplace 打开 Cursor Team Kit,确认页面显示“Verified by Cursor”后安装,并先阅读插件页列出的 agents、skills 和 rules。对一个真实分支或待合并 diff,先让 `check-compiler-errors` 跑编译/类型检查,再让 `ci-watcher` 观察当前 PR;需要做结构审查时调用页面列出的 `thermo-nuclear-code-quality-review`,把报告中的重构建议与现有测试逐条对照。不要一上来对整个生产仓库执行大规模自动改写,先在分支、干净工作树或小 PR 上试用,保留原始 diff 并让测试作为最终裁判。
为什么值得关注
它不是泛泛的“帮我写代码”提示词,而是把团队常见的验证、CI 和可维护性流程做成可发现的 Agent 能力;官方 Marketplace 同时展示源代码、技能名称和适用说明,便于审计。尤其是 code judo 式的重构审查,把“代码能跑”和“代码可维护”区分开,适合成熟代码库的二次质量控制。
应用场景
- 在 PR 期间自动检查编译、测试和 CI 状态,减少人工等待和漏看失败链接。
- 对长期演化的 TypeScript/前端仓库做结构、可维护性和重复逻辑审查。
🛠️ Mole
一句话
面向 macOS 的清理、卸载、磁盘分析、维护和状态监控工具;既有免费的 GPL-3.0 开源 CLI,也有带原生图形界面的 Mole for Mac。
怎么玩
如果想先低风险试用,在终端执行 `brew install mole`,用 `mo --help` 查看命令,再从 `mo purge --dry-run` 或 `mo installer --dry-run` 开始,只审阅将被处理的构建产物、DMG/PKG/ZIP 和缓存。确认清单无误后再执行实际清理;需要图形化查看、应用更新、卸载、磁盘地图或菜单栏状态时,改用 mole.fit 的 Mac App。每次大清理前先关闭相关开发工具、保留重要项目缓存策略,并把 dry-run 输出保存一份。CLI 与付费原生 App 是两个发行形态,许可证和功能不要混为一谈。
为什么值得关注
它把常见的清理、卸载和系统状态任务放进一个原生 Mac 工具,同时保留了开源 CLI 的可检查性;官方文档明确要求破坏性操作支持 `--dry-run`,比只给一个“一键加速”按钮更适合开发机。对经常切换 Node、Python、容器和大型构建产物的用户,先看清要删什么再执行,实用性很高。
应用场景
- 清理 Xcode、Node、Python 或项目构建残留,回收开发机磁盘空间。
- 卸载应用、分析目录占用,并通过菜单栏观察 Mac 的实时状态。
🛠️ FoloToy AI Passport
一句话
面向 AI Agent 开发的开放式可穿戴硬件项目,仓库把硬件事实、BSP 接口、示例、测试和 Agent 开发指南放在同一处。
怎么玩
这项需要真实硬件,先克隆仓库并按 `AGENTS.md`、硬件开发指南、`git status`、BSP 公共头文件的顺序建立上下文,不要直接凭照片猜引脚。安装匹配版本的 ESP-IDF 后,先运行主机侧轻量测试,再用 `idf.py build` 验证编译;手上有开发板时通过 USB Type-C 连接,按文档执行烧录和 `idf.py monitor`,逐项验收屏幕、按键、音频、蓝牙/NFC 等接口。让 Codex/Claude Code 修改前先要求它输出硬件约束和验收清单,最终明确区分 Build、Host tests、Device tests 和仍需人工确认的项目。
为什么值得关注
它不是只展示一个炫酷 Demo,而是把“让 Agent 真正改硬件代码”所需的源头优先级、资源边界、BSP、测试与验收方法写进仓库。硬件项目最容易因引脚、DMA、时序或设备差异产生幻觉式修复,这种面向 Agent 的工程资料组织方式值得其他 AI 硬件团队跟进。
应用场景
- 用自然语言驱动 Agent 开发语音输入、按钮交互或小型可穿戴设备 Demo。
- 研究 AI Agent 如何在有明确物理约束和设备验收的嵌入式项目中工作。