🛠️ CopilotKit OpenBot
一句话
开源的 AI coworker 平台,让每个 bot 拥有独立电脑、浏览器、文件和工具,并在动作发生前决策、发生后留痕。
怎么玩
先准备 Docker、Bun 1.3+、一个 CopilotKit Intelligence 项目和模型密钥,再克隆仓库并创建 .env。进入目录执行 bun install,然后运行 bash scripts/start.sh;脚本会启动数据库、浏览器电脑、监督服务、API 和前端,完成迁移并做健康检查。浏览器打开 http://localhost:3010,进入 /bot,先让 General Assistant 访问 news.ycombinator.com 并告诉你头条,再到 agents.yaml 或 /agents 页面改一个 coworker 的提示词和权限,观察每个动作如何经过治理网关。
为什么值得关注
它把“让模型调用工具”推进到“让组织敢把工具交给模型”。OpenBot 的网关会统一处理电脑、文件、MCP 和组件动作,策略缺失或规则出错时默认拒绝;同时保留人工接管、授权和审计轨迹。对想研究 agent 安全边界、企业权限和可回放执行流的人,比单纯聊天 Demo 更接近真实生产问题。
应用场景
- 给知识库、浏览器和内部工具配置受控的企业问答 coworker。
- 研究浏览器 agent 的审批、人工接管、MCP 权限和操作审计。
🛠️ oMLX:Apple Silicon 本地推理服务器
一句话
面向 Apple Silicon 的本地 LLM 推理服务器,提供连续批处理、SSD/KV 缓存、菜单栏管理和 OpenAI 兼容接口。
怎么玩
Mac 用户可以从 Releases 下载 .dmg,拖进 Applications;也可以执行 brew tap jundot/omlx https://github.com/jundot/omlx,再执行 brew install jundot/omlx/omlx。启动应用后先在模型管理界面下载一个适合内存的模型,再用内置聊天或跑分功能确认服务正常;需要接入其他客户端时,按仓库的 CLI Configuration 使用本地 OpenAI-compatible endpoint。想试 MCP 的话,再按 README 安装对应依赖,不要一开始就加载超出机器内存的大模型。
为什么值得关注
它不是又一个聊天前端,而是把 Apple Silicon 的内存和磁盘资源变成可复用的本地推理服务。连续批处理、缓存和原生 Swift 菜单栏应用,解决的是多任务排队、模型反复加载和桌面管理成本;同时保留 OpenAI/Anthropic 兼容方向,适合把本地模型接到已有 agent 工作流里做成本和隐私对照实验。
应用场景
- 在 Mac 上给 Claude Code 或其他 API 客户端提供本地模型后端。
- 对比不同量化模型的速度、缓存命中和内存占用。
🛠️ Qiaomu Learning:苏格拉底式学习 Skill
一句话
把主题、网页、截图、PDF 或笔记变成一次只问一个问题的苏格拉底式学习对话,并根据回答调整下一步。
怎么玩
在支持 skills 的 agent 宿主中执行 npx skills add joeseesun/qiaomu-learning,安装后直接说“带我学习某个主题,一次只问一个问题,不要直接告诉我答案”。可以把 Omarchy 手册、课程 PDF 或一段代码作为材料交给它,让 agent 先确认材料范围,再逐步追问;回答后要求它指出推理漏洞、用自己的话复述,并在最后做一次迁移题。仓库还提供静态包验证脚本,想改 skill 时可运行 python3 scripts/validate_skill.py . 检查结构和契约。
为什么值得关注
它把“让模型解释”改成“让学习者自己推导”,并把一次一问、渐进黑板、掌握状态和材料边界写进了可复用 Skill。对 agent 用户来说,真正有价值的不只是提示词,而是把学习过程封装成可重复触发、可验证、可退出的工作流,适合测试 Skills 是否能沉淀方法而不是只生成一段漂亮答案。
应用场景
- 用本地手册、论文或代码库做主动回忆和逐步学习。
- 为团队培训、技术 onboarding 或复杂概念复习制作交互式学习流程。
🛠️ JSEF v1.9 Benchmark:可复现的 Java 安全实验框架
一句话
面向 Spring Boot 的 Web 安全学习与测试项目,把漏洞原理、复现、不安全实现和修复实现放进可运行的实验环境。
怎么玩
先 git clone https://github.com/XiaomingX/JSEF,再按 README 选择 Maven 或 Docker。Docker 路线可以执行 docker build -t jsef-security-sample:latest .,随后执行 docker run -d -p 8080:8080 --name jsef-demo jsef-security-sample:latest;启动后按项目文档访问实验接口,逐个对照 unsafe 和 safe 路由。想看推文提到的新版 benchmark,则进入 Releases 找 v1.9.0-benchmark,记录样本、checkpoint 和本地运行结果,再把模型生成的修复建议与实际测试结果分开核对。
为什么值得关注
它的亮点不是把“AI 安全”停在口号,而是把可复现样本、漏洞链、代码对照和修复验证放到同一项目里。推文强调了 checkpoint 双重标注和可重复 scorecard,官方仓库则给出 Docker、Spring Boot 和真实业务场景,适合用来评估 SAST、LLM 修复代理在跨漏洞链任务中的真实能力,而不是只看单个漏洞命中率。
应用场景
- 学习 Java Web 漏洞原理,并在本地复现和验证修复。
- 为代码安全 agent 构造有标签、可回归、可审计的评测集。
🛠️ mimofan:Rust 终端 AI 编程助手
一句话
本地优先的 Rust 终端编程 agent,支持 MiMo、DeepSeek、OpenAI、通义千问等模型,并能读代码、改文件、跑命令和执行验证。
怎么玩
有 Rust 环境时,在仓库目录执行 cargo install --path crates/tui --locked;不想编译则从 Releases 下载预编译二进制。首次运行 mimofan 会进入配置向导,也可以按 README 在 ~/.mimofan/config.toml 配置 provider。先用 mimofan doctor 检查环境,再用 mimofan 启动 TUI,或执行 mimofan exec "帮我为这个项目写一个测试并运行验证"。建议先用 Plan 模式审阅计划,再给一个小型仓库测试长期记忆、apply_patch、危险操作确认和错误修复,不要直接在重要项目开启 YOLO。
为什么值得关注
mimofan 把终端代理的可控性和本地优先放在一起:危险操作先询问、Spec Freeze 防止偏离计划、Issue Monitor 连接 GitHub 问题,近期版本还在加强长期记忆和多模型协作。它的 Rust 单体部署、MIT 协议和多 provider 兼容,让用户可以把“国产模型 + 本地 agent + 可审计执行”作为一条完整路线来试,而不是只能使用闭源桌面产品。
应用场景
- 在本地代码库中完成从读结构、改代码到测试修复的闭环。
- 研究长期记忆、计划冻结、子代理和危险操作审批如何影响编码质量。
🛠️ ColaMD 1.9.0:Agent Native Markdown 编辑器
一句话
把 Markdown 当作内容数据库的桌面编辑器,能实时看到 agent 改动,并在 1.9.0 中加入 Word、PDF/HTML 和阅读页导出能力。
怎么玩
从 Releases 下载适合系统的安装包,macOS 可选 Apple Silicon 的 .dmg;不想安装也可以克隆源码后执行 npm install 和 npm run dev。打开一个已有 .md 文件,再让 Claude Code、Cursor 或其他 agent 修改标题、列表和图片,观察 ColaMD 是否实时刷新,并用菜单里的导出功能生成 docx、PDF 或 HTML。最后把同一份 Markdown 同时交给 agent 和 Word 用户,检查格式、图片和标题层级是否保持,体验它作为内容层而不是普通笔记本的差异。
为什么值得关注
它抓住了 agent 工作流里常被忽略的交付层:模型负责修改 Markdown,人需要实时看到变化、审阅格式,并把结果交给不使用 Markdown 的协作者。官方 README 明确支持 Live Agent Sync、WYSIWYG、富文本复制和跨平台导出,1.9.0 又补上 Word 与文档结构能力,适合验证“文件是接口、编辑器是观察面”的新型协作方式。
应用场景
- 让 agent 维护产品文档、方案、简历或幻灯片源文件,并实时人工审阅。
- 把 Markdown 内容快速交付为 Word、PDF、HTML 或阅读页面。
🛠️ Berd:Block 的开源桌面 Agent 工作空间
一句话
Block 开源的桌面 agent 应用,把项目、会话、技能、文件和不同 harness 放进一个本地工作空间,并通过 ACP 连接 Goose 后端。
怎么玩
想直接体验可先查看仓库是否提供对应平台构建物;如果要从源码研究,准备 Rust/Tauri、Node 和 just,克隆仓库后执行 just setup,再执行 just dev。启动后创建一个项目,连接本地或已配置的 Goose agent,分别测试新会话、上下文文件、技能和模型切换。把一个小任务交给 agent,观察前端工作空间如何管理会话和文件;再阅读 Goose/ACP 连接配置,确认 UI 层与 agent runtime 的边界,不要把它误当成新的模型服务。
为什么值得关注
Berd 的价值在于把多种模型和 harness 的“使用面”统一起来,同时不吞掉底层 agent runtime。官方仓库说明它用 Tauri 2、React 19,通过 ACP WebSocket 调用 Goose;这为桌面端 agent 的项目持久化、上下文管理、模型切换和企业分发提供了一个可读源码的样本,也提醒我们开源许可证与社区治理并不等价。
应用场景
- 在桌面上集中管理多个 agent 项目、会话、文件和技能。
- 研究 ACP、Goose runtime 与桌面 UI 如何分层协作。
📡 AI 科学代理走入蛋白质设计与化学分析
事件
Anthropic 分享 Claude 在蛋白质 binder 设计和 NMR/LC-MS 分析中的实验结果,推文重点是模型协调开源工具完成科学流程,而不是只生成一段说明文字。
解读
官方材料称,Claude 在 15 个可解释目标中的 14 个设计出了结合物,整体命中率按设置约为 22%–35%,并由外部实验室完成湿实验验证;在化学分析任务中,模型用原始数据完成 NMR 与 LC-MS 处理,结果与实验室数据接近。这里真正值得关注的不是“模型会生物学”这一句营销式概括,而是它能选择工具、分配计算、筛选候选、保存决策,再把结果交给实验环节验证。外部实验仍然昂贵且耗时,官方案例也不是同行评审结论,因此应把它看成 agentic science 的强信号,而不是已经能独立研发药物的证明。参考:https://www.anthropic.com/research/Claude-accelerates-protein-design
影响评估
如果这类工作流继续稳定,科研软件的竞争点会从单个预测模型转向“模型 + 开源工具 + 计算资源 + 实验反馈”的闭环编排。实验室可能先把重复分析、候选排序和文献/数据整理交给 agent,把专家时间集中到目标选择、风险判断和实验设计;同时,生物安全、数据权限和结果复现会成为商业落地的硬门槛,而不是发布后的附加项。
📡 GLM-5.3:后训练本身成为编码能力的主战场
事件
智谱/ Z.ai 发布 GLM-5.3,官方强调沿用 GLM-5.2 底座,主要通过长周期任务环境、强化学习和后训练提升复杂编码与 agent 能力。
解读
这条动态的含义不只是又多了一个模型名。Z.ai 官方博客称 GLM-5.3 在内部 Code Bench 上较 GLM-5.2 提升 50%,Terminal-Bench 3.0 从 4.6 提到 28.3,DeepSWE v1.1 从 46.2 提到 66.9;同时官方承认环境生成和验证仍有相当的人工作业。也就是说,收益来自更贴近真实工程生命周期的训练环境:识别问题、实现、运行测试、交付结果,而不是只刷短题。供应商自报数据仍需社区复测,开源权重和许可证的实际可用性也要单独确认。参考:https://z.ai/blog/glm-5.3
影响评估
模型公司的资源配置会继续从“训练更大底座”转向“构建更好的任务环境、评测和反馈回路”。对开发者而言,选择模型时要看它在具体 harness、上下文长度、工具调用、token 成本和失败恢复上的表现,不能只看通用榜单;对开源生态而言,真正稀缺的可能是高质量长周期任务、可复现执行环境和能防止 benchmark 泄漏的验证集。