今天的信号很集中:AI 正从“聊天窗口里的模型”继续下沉为能被 Agent 调用、能在本地运行、能接管真实设备和工作流的基础设施;设计、视频、语音、手机控制与多会话开发都在朝这个方向靠拢。本次证据包已生成,覆盖 83 个 X 候选,但 6 路 HNRSS 请求均返回 502,因此 HN 线索不作为已验证结论;证据不足的新名词统一保留在“刚露头”,不硬凑成工具。
今天的信号很集中:AI 正从“聊天窗口里的模型”继续下沉为能被 Agent 调用、能在本地运行、能接管真实设备和工作流的基础设施;设计、视频、语音、手机控制与多会话开发都在朝这个方向靠拢。本次证据包已生成,覆盖 83 个 X 候选,但 6 路 HNRSS 请求均返回 502,因此 HN 线索不作为已验证结论;证据不足的新名词统一保留在“刚露头”,不硬凑成工具。
把 Claude Design 的设计方法打包为可在 Cursor、Claude Code、Codex 等本地 Agent 中运行的 Skill,用自然语言生成高保真界面、交互原型、线框、落地页、仪表盘和演示文稿等自包含 HTML 产物。
先准备 Node.js 和一个支持读取项目文件的 Agent,在项目目录执行 `npx skills add JimLiu/baoyu-design`,按 README 将 Skill 安装到对应 Agent。然后在 Agent 中给出一个具体需求,例如“基于这张截图做一个可点击的设置页”,让它先收集设计上下文、生成 HTML,再用本地预览或 Agent 的浏览器检查。把生成物保存到项目的 designs 目录,继续用“指出这个按钮并改成……”的方式迭代;如果要做 PPT、移动端原型或数据看板,再明确写出目标载体和交互流程。
它把原本依赖网站订阅的设计流程变成了可版本控制、可复用、可被其他代码 Agent 继续调用的本地资产。官方仓库明确支持自包含 HTML、原型预览和多种导出方向,且仓库在本次证据采集时已有约 3.3k stars;对独立开发者来说,设计稿不再是一次性图片,而是能进入代码仓库的可执行中间层。
BaoCut 是 macOS 视频工具,配套的开源 Agent Skill 可让 Claude Code、Codex 等 Agent 调用本地 CLI,完成视频转录、字幕、翻译、说话人处理、时间线编辑与导出。
先从 baocut.app 安装 BaoCut.app,再按官方仓库执行 `npx skills add JimLiu/baocut -g -a claude-code codex -y`,让 Skill 注册到本机 Agent。把一个本地视频交给 Claude Code 或 Codex,先要求“转录并标出说话人”,再要求“翻译成中英双语字幕、删掉指定段落并导出预览”。如果不想打开完整 GUI,也可以让 Agent 使用 `bcut` CLI;先检查输出文本和时间轴,再执行字幕烧录或最终导出,避免把一次错误剪辑直接覆盖源文件。
它体现了“App 负责确认和微调、Agent 负责操作”的新交互,而不是再做一个孤立的剪辑聊天框。官方仓库把 CLI、解析器和 Agent Skill 分层,支持 Claude Code、Codex 及兼容 skills.sh 的 Agent;视频处理结果还能回到本地文件和网页界面继续复核,适合把重复的转录、翻译和粗剪流程变成可复用命令。
Phone Harness 是一个开源 macOS harness,利用 iPhone Mirroring 窗口、屏幕捕获、Vision OCR 和 HID 级 CGEvent 输入,让 Agent 读取并操作真实 iPhone,不需要越狱、Xcode 或 WebDriverAgent。
https://github.com/ShawnPana/phone-harness ↗
https://github.com/ShawnPana/phone-harness/blob/main/install.md ↗
先把 iPhone 与 macOS 的 iPhone Mirroring 配对,再克隆仓库到 `~/.phone-harness`,阅读 `install.md` 后执行可编辑安装,并用 `phone-harness skill` 注册 Agent Skill。首次运行必须在 macOS“隐私与安全性”里给终端授予辅助功能和屏幕录制权限,然后执行 `./phone-harness --doctor` 检查窗口、权限和连接状态。连接成功且手机解锁后,可以让 Agent 先调用 OCR 读取 Home Screen,再用 `open_app("Weather")`、`tap_text(...)`、`type_text(...)` 做无害测试;每一步都重新截图确认结果,不要让 Agent 直接执行支付、删除或发消息等不可逆操作。
它把移动端自动化从脆弱的坐标脚本推进到“截图观察—输入动作—再次验证”的 Agent 闭环,传输层直接复用 macOS 已经能看到的镜像窗口。官方实现还把可编辑的 helper 放进 agent-workspace,方便针对特定 App 补充动作;但它依赖配对和系统权限,适合实验与个人自动化,不应未经确认接管敏感账户。
Herdr 是一个 Rust 编写的终端 Agent runtime/multiplexer,把 Claude Code、Codex 等 Agent 放进可持续的终端会话,支持分屏、鼠标操作、工作状态识别、远程重新连接和 Agent 间协作。
macOS 上可以先执行 `brew install herdr`,然后在项目所在目录运行 `herdr`。在一个 workspace 里创建多个 session 或 pane,分别启动 Claude Code、Codex 或其他受支持的 Agent;用鼠标或 tmux 风格快捷键切换、分屏和查看输出。需要离开电脑时按文档方式 detach,之后在同一台机器或 SSH 中重新运行 `herdr` 连接回来,先查看哪些 pane 处于 working、blocked、done 或 idle,再只处理需要回答的问题。想从脚本或另一个 Agent 管理会话时,再阅读官方 socket API,不要直接依赖未经文档说明的内部协议。
普通终端 multiplexer 解决的是“窗口还在不在”,Herdr 进一步把 Agent 的工作状态、阻塞状态和注意力管理作为一等对象。官方仓库强调后台运行、断网或合盖后仍可恢复,并提供 CLI 与 socket API;这更接近 Agent 的长期运行时,而不只是把多个聊天窗口拼到一起。对多 Agent 并行开发,减少手动轮询和错过阻塞提问尤其有价值。
Mole 是一个开源 macOS 命令行工具,把清理缓存、卸载应用、磁盘分析、系统优化和 CPU/内存/磁盘/网络监控集中到一个终端工具里。
在 macOS 14 或更新版本上先执行 `brew install mole`,安装后运行 `mole` 或 `mo` 查看交互式菜单。第一次不要直接清理,先用 `mo analyze` 或磁盘分析功能定位开发工具、浏览器、模型客户端和项目构建目录占用的空间,再查看扫描结果和保护规则;确认白名单后再执行 clean。需要卸载应用时先让 Mole 列出关联的 launch agent、偏好设置和残留文件,逐项确认后再移除。AI Coding 产生的 node_modules、build、venv、target 和缓存很容易反复增长,建议把清理作为每周维护而不是临时救火。
官方仓库明确区分了免费的开源 CLI 和独立的商业 Mac App,CLI 本身不依赖云端,适合开发者审计和脚本化维护。它把 AI 工具缓存、开发构建产物和系统状态放在同一套可预览流程里;尤其是 `mo analyze` 先分析、再把文件移入废纸篓的路径,比“清理软件一键全删”更适合 Agent 高频写代码的机器。
KeySteer 是 Windows/macOS 原生开源工具,用 hjkl、Grid、Recursive Grid 和 UI Hint 移动、点击、拖拽鼠标,并为按钮、链接、菜单和输入框显示可键入标签。
从官方 Releases 下载与系统和 CPU 架构匹配的 ZIP;macOS 解压后把 `KeySteer.app` 放到 `/Applications`,首次打开前按文档授予辅助功能和屏幕录制权限。进入 Normal 模式后用 `h/j/k/l` 移动,用 `;`、`'` 或右 Shift 点击,用 `n` 切换按住状态来拖拽;按 `g` 进入 Grid,按 `f` 进入递归 Grid,按 `Command+F` 进入 UI Hint,为当前界面控件生成标签。先在普通网页或设置页测试,再按自己的习惯修改 TOML 配置和跨显示器快捷键。
它不是把鼠标动作录成固定坐标,而是把键盘导航、屏幕区域细分和辅助功能树/Vision 提示组合起来,能适应窗口位置变化。官方 README 同时覆盖 macOS Accessibility Tree、Vision、Hybrid 和 Windows UI Automation;这类“可定位的操作层”既能提升键盘用户效率,也可能成为桌面 Agent 进行可验证点击的低层执行器。
Rudoc 是一个小型、无运行时依赖的 Rust 文档转换器,用单个二进制覆盖 Markdown、HTML、TXT、DOCX、Typst、PDF、PPTX、CSV/XLSX、XML/OPML/JSON 等常见转换。
在 macOS Apple Silicon 上从官方 Releases 下载 `rudoc-macos-arm64` 压缩包,解压后把二进制放进 PATH;也可以在有 Rust 的环境从源码构建。最简单的用法是 `rudoc notes.md notes.html`,程序按扩展名自动判断输入和输出格式;需要标准输出时再组合管道,做 Markdown 到 HTML、TXT 到 DOCX 或 Markdown 到 PPTX 的小转换。先用 `--help` 查看格式和 PDF 选项,注意 PDF 读取主要是文本提取、复杂 PPTX 格式兼容性有限,不要把它当成 Pandoc 的全功能替代品。
Rudoc 的价值不是格式覆盖最多,而是把“偶尔需要的转换”压缩成一个约 4–6MB、启动很快、没有 GHC 或复杂运行时的二进制。官方 README 给出了静态发布包和明确的格式边界,Hacker News 的 Show HN 讨论也强调了它面向 Markdown/HTML 等日常小流程;对 Agent 来说,小而确定的 CLI 比调用重量级 GUI 更容易组合和复现。
Hugging Face 的 Speech-to-Speech 提供 VAD→STT→LLM→TTS 的模块化语音 Agent 管道,并通过 OpenAI Realtime 兼容的 WebSocket API 暴露实时对话能力。
准备 Python 3.10+ 后执行 `pip install speech-to-speech`。想快速体验,可以运行 `speech-to-speech local`,让服务端和麦克风/扬声器客户端在本机回环;也可以先启动 `speech-to-speech serve`,再在另一个终端运行 `speech-to-speech talk --url ws://127.0.0.1:8765/v1/realtime`。默认路径使用本地 Parakeet TDT 做语音识别、Qwen3-TTS 做语音输出,并连接一个 OpenAI 兼容的 LLM;有 Apple Silicon 或合适显卡后,再把 LLM 指向 llama.cpp/vLLM,逐步替换 VAD、STT、TTS 组件并测量延迟。
它把语音 Agent 的关键环节拆成独立线程和队列,每个组件都能替换,且客户端无需重写协议就能从托管 Realtime 端点切到自托管服务。官方仓库还说明该管道已用于 Reachy Mini 的对话后端;对想研究实时打断、轮次检测和全本地语音的人来说,既有可运行入口,也有清晰的模块边界。
NextSlide 宣布加入 OpenAI,团队成员转入 ChatGPT 相关工作,交易据报道发生在 2026 年更早时候,财务条款未公开。
NextSlide 原本解决的是把提示词、笔记、文档或研究资料变成精致且可编辑演示文稿的问题。TechCrunch 的报道(https://techcrunch.com/2026/08/08/openai-acquires-presentation-startup-nextslide)确认了团队加入 ChatGPT 以及产品方向,但这不等于 NextSlide 作为独立产品会继续对外提供。值得看的不是又多了一个 PPT 生成器,而是视觉表达、内容组织和可编辑交付正在成为通用 Agent 的一部分:用户可能不再先打开演示软件,而是直接把研究和目标交给 ChatGPT,再由模型生成、修改并交付可继续编辑的结果。
这会把“生成一套页面”从单点生产力功能推向更完整的知识工作流,可能压缩传统演示工具在大纲、版式和初稿环节的差异化空间。对创业团队来说,真正的壁垒会转向企业模板、事实核验、品牌规范、协作和可编辑格式;对用户来说,短期应关注能力是否真正落地,而不是把一次收购直接等同于产品上线。
研究者用基因组模型 Evo 生成候选病毒基因组,并在实验室合成测试,约 300 个候选中有 16 个被确认能感染并复制于大肠杆菌的噬菌体。
这条消息需要把“病毒”与“人类病原体”区分开:CNN 的报道(https://www.cnn.com/2026/08/06/health/ai-viruses-bacteriophages)说明这些是针对细菌的噬菌体,不能感染人类;研究团队还刻意把人类、动物和植物相关病原体数据排除在训练范围外。它的技术意义在于模型不只是从已有序列做分类,而是提出新的完整基因组,再由实验筛选功能。成功率并不意味着模型能随意生成生物体,却证明“模型提出候选—实验验证—再迭代”的闭环正在变得现实。
医疗上,面向耐药细菌定制噬菌体组合可能打开新的治疗研究路径;安全上,能够生成并筛选完整基因组也提高了双重用途风险,监管、实验室生物安全和模型访问控制必须同步建设。行业评价不能只看 16 个成功样本,还要看数据排除、合成门槛、可复制性和审查机制,避免把论文结果夸大成“AI 已能制造人类病毒”。
X List 传出国行 Apple Intelligence 配套手册已出现“在 Mac 上配合 Apple 智能使用千问”,Apple 官方支持页已经上线同名中文文档。
Apple 官方手册(https://support.apple.com/zh-cn/guide/mac-help/mchl46b3ab20/mac)至少确认了“Mac 配合 Apple 智能使用千问”这一文档入口;原推文进一步称相关能力将随 macOS 26.6 推进,但具体地区、系统版本、机型和功能范围仍应以设备上的正式更新说明为准。这个变化的关键不只是换一个模型,而是把中文模型放进操作系统级的写作、理解和跨 App 场景,模型选择开始受地区合规、语言质量、隐私和系统体验共同约束。
如果落地范围扩大,国内用户获取系统级生成式功能的门槛会下降,也会推动模型厂商从独立 App 竞争转向操作系统入口竞争。对开发者而言,需要重新评估系统 AI 调用、中文内容质量和数据边界;对普通用户而言,先确认自己的国行设备、系统版本和 Apple Intelligence 开关是否满足条件,不要仅凭社交平台截图判断“已全面可用”。