今天的 X List 共抓到 95 条推文,最值得上手的信号集中在“Coding Agent 运行时、可组合 Harness、Agent as Code、本地 MoE 推理和可验证工具调用”这条线上。Agent Reach 多源证据包本次在限定时间内超时且没有生成日期文件,所以下文的🛠️项目均改用推文加官网、GitHub、官方文档、官方状态页或可信媒体人工交叉核验;🌱部分明确标注“证据待补”。
今天的 X List 共抓到 95 条推文,最值得上手的信号集中在“Coding Agent 运行时、可组合 Harness、Agent as Code、本地 MoE 推理和可验证工具调用”这条线上。Agent Reach 多源证据包本次在限定时间内超时且没有生成日期文件,所以下文的🛠️项目均改用推文加官网、GitHub、官方文档、官方状态页或可信媒体人工交叉核验;🌱部分明确标注“证据待补”。
Herdr 是一个面向 Claude Code、Codex、Pi、OpenCode 等 Coding Agent 的后台终端运行时和工作区管理器,让 Agent 在真实终端里持续工作,人离开、断网或关闭终端后仍可回连。
macOS 可以先执行 `brew install herdr`,然后在项目目录运行 `herdr`,它会启动或接入默认后台会话;在工作区里的 pane 中启动 `claude`、`codex`、`pi` 或 `opencode`,Herdr 会自动识别 Agent,并在侧栏显示 working、blocked、done、idle 等状态。用 `Ctrl+B` 进入前缀模式,可用 `prefix+v`、`prefix+-` 分割 pane,用 `prefix+c` 新建标签页,用 `prefix+q` 脱离会话;重新运行 `herdr` 即可回到原来的 Agent。先拿一个需要运行十几分钟的代码重构任务测试断开和重连,再尝试多工作区并行。
它不是另一个包裹模型的 Agent 产品,而是把“终端、会话、状态和远程回连”做成基础运行时。对同时使用多个 Coding Agent 的人来说,真正的瓶颈常常不是模型能力,而是任务在后台是否持续、是否能快速发现卡住的 pane,以及能否保留完整 shell 和日志。Rust 单二进制、无 Electron、兼容既有 Agent 的路线也更适合长期放在开发机或服务器上。
ElevenLabs CLI 是 ElevenLabs voice agents 的命令行和配置管理工具,可把 Agent 配置、工具、测试和分支放进版本库,并通过 push 与 CI/CD 同步到平台。
准备 Node.js 16 或更高版本后执行 `npm install -g @elevenlabs/cli`,在一个空目录运行 `elevenlabs agents init` 初始化 `agents.json`、`tools.json`、`tests.json` 和配置目录;接着执行 `elevenlabs auth login` 完成认证,再用 `elevenlabs agents add "My Assistant" --template assistant` 创建模板 Agent。编辑 `agent_configs` 中的提示词、模型、语音和工具后,先运行 `elevenlabs agents push --dry-run` 预览差异,再运行 `elevenlabs agents push` 发布;还可以用 `agents pull`、`agents status` 和 `agents widget` 做同步、检查和网页嵌入。把配置提交到 Git,再把 API Key 放在 CI 密钥中,不要写入仓库。
语音 Agent 正从“网页控制台里的配置”变成可审查、可回滚、可自动部署的软件资产。CLI 提供模板、hash 变更检测、工具管理、分支同步和 widget 生成,意味着团队可以像维护后端服务一样维护语音交互逻辑。它还提供 `generate-skills` 为 Coding Agent 生成命令说明,降低了让其他 Agent 参与维护的上下文成本。
DeepSeek Harness(dsh)是 DeepSeek AI 开源的 Agent Harness,基于 Cordis 插件系统,把模型、工具、Skills、Session、Sandbox、存储、循环、调度和 UI 等能力拆成可替换组件。
先安装 Node.js,在终端执行 `npx @deepseek-ai/dsh web` 直接启动 Web UI;如果想研究实现或二次开发,则运行 `git clone https://github.com/deepseek-ai/deepseek-harness.git`,进入目录后按仓库说明执行 `pnpm install`、`pnpm run build` 和 `pnpm dsh web`。启动后先用 Standard mode 做普通工具调用,再对比 Minimal mode 的 shell 加文件编辑器、Code mode 的模型生成代码编排,以及 Creator mode 的插件组合。接着选一个模型、工具或 Session 插件替换,记录同一任务在不同组合下的行为差异;项目仍是 developer preview,实验时要固定版本并保留日志。
它把 Agent 的扩展边界从“在固定循环旁边挂钩子”推进到“运行时本身由能力组件组成”。如果模型、工具、上下文压缩、持久化和调度都能独立替换,开发者就能针对不同任务构建不同 Harness,而不是被某个预设 Agent 的产品形态锁定。更重要的是,这种架构将可复现性、插件 ABI 和会话日志放到核心设计里,适合做 Agent 框架研究和实验性基础设施。
FreeToken 是面向边缘设备的 MoE 推理引擎,把 GPU、CPU、主机内存和互连视为统一资源,目标是在个人电脑或工作站上服务大型开源 MoE 模型,并提供 OpenAI 与 Anthropic 兼容接口。
https://github.com/FlashML-org/FreeToken ↗
https://github.com/FlashML-org/FreeToken/blob/main/docs/quickstart.md ↗
它主要面向 Linux/Windows 和 NVIDIA GPU,先克隆仓库并创建环境:`git clone https://github.com/FlashML-org/FreeToken.git && cd FreeToken`,随后按 README 用 `uv venv` 和 `uv pip install -e ".[accel]"` 安装。准备一个受支持的 Hugging Face 模型后,按 quickstart 启动服务,看到 `API server is ready to serve on 127.0.0.1:1919` 再访问 `/v1/models` 确认模型 ID;然后用 OpenAI 客户端或 curl 调用 `/v1/chat/completions`,也可以用 `ft shell` 进入终端聊天。第一轮建议从较小 MoE 和短上下文开始,逐步观察显存、主机内存、PCIe 传输和 token 延迟,不要直接把 290B 级模型当作普通笔记本任务。
FreeToken 的关键不是简单把权重塞进 CPU,而是根据带宽动态决定 CPU 执行与 GPU 缓存填充,并用专家缓存和语义边界检查点减少 Agent 多轮编辑后的重复计算。官方仓库还明确提供 OpenAI/Anthropic 兼容 API,这让本地引擎可以接到 Codex、Claude Code、OpenCode 或其他工具调用客户端。它代表一条“软件重新编排已有硬件”路线,可能比单纯等待更大显存更现实。
Apodex AgentHarness 是 Apodex 团队开源的评测 Harness,用标准 ReAct 设置复现 Apodex 模型在 BrowseComp、DeepSearchQA、HLE 等公开 Deep Research 基准上的结果。
先从 GitHub 克隆仓库,按 `pyproject.toml` 使用 uv 建立 Python 环境并安装依赖;随后准备一个 OpenAI 兼容的模型服务,在 `.env` 中配置 `OPENAI_BASE_URL`、`OPENAI_API_KEY`、`OPENAI_MODEL`,需要联网检索、网页读取和代码沙箱时再分别配置 Serper、Jina 与 E2B。下载仓库要求的公开基准数据,先运行一个 smoke test,确认单题可以产生轨迹,再选择 BrowseComp、BrowseComp-ZH、DeepSearchQA 或 WideSearch 执行批量评测。官方仓库把每道题放进独立子进程,便于追踪失败;若只想体验产品,可先访问 Apodex 官网或 Hugging Face 页面,区分在线服务与本地复现实验。
Apodex 的公开材料把重点放在“验证每一步、对外部证据做主动检索和让结果可审计”,而 AgentHarness 则把这种主张落成了可运行的基准流程。对 Deep Research 来说,最终答案看起来合理并不等于搜索路径、证据和结论可靠;把模型服务、工具、数据集和评测配置拆开,才能比较不同模型或不同 Harness 的真实差异。需要注意的是,仓库公开说明主要对应 Apodex-1.0 的可复现实验,1.1 的具体模型与接口版本应以官方最新页面为准。
ThinkingBox 是微软开源的 MCP 工具环境、模拟用户和 Agent 评测框架,ThinkingBox-Bench 则提供 507 个跨零售、旅行、保险、银行支持和 IT/HR 的有状态业务任务。
项目目前主要测试 Linux,macOS 用户可以在 Linux 虚拟机或 WSL 环境中尝试。先克隆 `microsoft/thinkingbox`,按官方推荐用 Python 3.12 和 uv 安装,再用仓库自带的 `cloud_drive` 场景验证安装:一个终端运行 `uv run tb mcp-start`,另一个终端用 `uv run tb infer` 执行测试,最后用 `uv run tb pp output.yaml` 查看对话和断言。要跑真实 benchmark,再单独克隆 `thinkingbox-data`,按 release README 准备任务、工具服务器和配置,记录 pass@1、pass@20 与全 20 次成功率。先从一个场景开始,确认工具副作用和终态断言都能复现,再扩大批量。
很多 Agent 评测只看最终文本或单次工具调用,容易把“说已经完成但数据库根本没改”的失败当成成功。ThinkingBox 为每次运行提供固定初始状态、受控 MCP 工具、可响应的模拟用户和干净环境,并对最终后端状态及副作用执行断言。507 个任务覆盖真实业务常见的多轮澄清、政策约束和不可逆操作,能把 Agent 的偶然成功与稳定可靠区分开。
Addy Osmani 的 agent-skills 仓库把前端、API 设计、测试驱动开发等工程方法写成可被 Coding Agent 读取和触发的 SKILL.md 操作规程。
https://github.com/addyosmani/agent-skills ↗
https://github.com/addyosmani/agent-skills/blob/main/skills/frontend-ui-engineering/SKILL.md ↗
最直接的方式是进入自己的代码项目,运行 `npx skills add https://github.com/addyosmani/agent-skills --skill frontend-ui-engineering`,然后查看生成的 skill 文件和项目约定是否被正确安装;也可以直接克隆仓库,先阅读 `skills/frontend-ui-engineering/SKILL.md`,再把其中适合团队的规则复制到自己的 Agent Skills 目录。用一个真实页面改造任务做对照实验:第一遍不加载 Skill,第二遍加载后要求 Agent 同时完成组件结构、响应式、WCAG 2.1 AA 和视觉验收,比较计划、代码和测试结果。不要把所有 Skill 一次性塞进全局上下文,按任务选择并锁定版本。
这类 Skill 不是一段泛泛的提示词,而是把触发条件、工作步骤、质量门槛和反例组织成可复用的行为规范。它解决了“模型会写代码但总是产出相同 AI 味界面”以及“团队经验无法稳定传给 Agent”的问题。对工程团队而言,Skill 文件还可以像代码一样评审、版本化和逐步迭代,把隐性的设计与测试标准变成可审计资产。
LDA-1B 是一个机器人基础模型和开源研究项目,在 3 万小时以上的人类与机器人交互数据上联合学习动力学、视觉预测和动作策略,并提供代码与预训练权重入口。
先克隆 `https://github.com/jiangranlv/latent-dynamics-action`,按仓库的 Python/环境说明安装依赖,再从 Hugging Face 下载 LDA-pretrain 或 RoboCasa 模型。项目依赖 Qwen3-VL 和 DINOv3,第一次建议不要直接接真实机器人,而是使用仓库 `playground/demo_data` 做数据加载和 open-loop 评估;确认样本、视觉特征和 action chunk 能跑通后,再阅读 `examples` 与 RoboCasa 配置,替换数据目录和训练参数。若只有 Mac 或没有 CUDA,优先阅读项目页面、运行数据预处理或静态检查,完整训练和闭环控制应放到有合适 GPU 与机器人仿真环境的 Linux 机器上。
LDA-1B 的研究路线不是只扩大高质量遥操作数据,而是让不同质量的数据承担不同角色:高质量轨迹用于策略,低质量轨迹帮助动力学学习,无动作视频用于视觉预测,并在结构化 DINO 潜空间中预测未来状态。这样可以减少像素级外观变化对训练的干扰,也为把公开视频、模拟数据和真实机器人数据统一起来提供了更清晰的工程接口。
8 月 24 日 Anthropic 状态页记录了多个 Claude 模型请求错误及登录问题,影响范围涉及 Claude.ai、Claude API、Claude Code 与 Claude Cowork;官方随后标记相关事件恢复或进入监控。
这次事件的重要性不只在于某个模型短暂不可用,而在于多个模型和产品面同时出现错误。官方状态页记录了 Mythos 5、Fable 5、Opus 5、Opus 4.8 等模型的 elevated errors,也记录了 Claude.ai 和 Claude Code 登录链路的问题。用户在 X 上描述的 529、长程任务 API error 和数小时恢复,与“模型能力很强”形成了明显反差:当聊天、编程 Agent、API 和协作产品共享路由、认证或容量层时,单一基础设施故障会同时放大到不同工作流。具体根因若官方没有公开,就不能把它简单归因于过载、缓存或某个模型发布。
对个人用户,关键任务不应只依赖一个云端模型,至少要准备可切换的模型、可重放的任务日志和指数退避;对企业,SLA 不能只看 API 200/非 200,还应监控模型路由、工具调用、认证和长任务恢复率。Coding Agent 尤其需要 checkpoint、幂等工具和中断后续跑机制,否则一次供应商故障可能留下半完成的代码和不可追踪的副作用。
字节跳动据报道将 TRAE、扣子(Coze)团队并入豆包体系,TRAE Work 与扣子能力向工作场景整合,TRAE IDE/CLI 则继续作为豆包品牌下的编程产品线发展。
这不是简单的团队调动,而是产品入口和资源分配的重新排序。TRAE 原本偏 AI 编程,扣子偏 Agent 构建与工作流,二者进入豆包体系后,字节更可能把模型、办公助手、连接器、远程控制和编程能力放进同一个分发入口。外部报道还提到“豆包工作”品牌可能独立推出,但现阶段应把它视为媒体报道和公司整合方向,不要把尚未正式发布的功能当成既成事实。对于开发者,最值得观察的是 TRAE IDE/CLI 的品牌变化是否伴随模型、插件、账号和计费体系迁移。
国内办公 AI 的竞争会从单点写作、单点 IDE 或单点 Bot,转向“统一模型入口 + 连接器 + Agent 工作流 + 企业权限”的组合。统一入口有利于降低用户切换成本,但也可能带来供应商锁定和产品边界模糊。团队在选型时应把项目导出、API 兼容、数据权限和模型替换能力列为硬指标,不能只看一次演示中的自动化效果。
Reuters 转述 Business Insider 称,Hugging Face 正探索出售,潜在估值可能达到 130 亿美元或更高;报道强调仍处于早期接触阶段,没有最终协议。
Hugging Face 的特殊性在于它既是模型与数据集托管平台,也是开源社区、推理生态和企业服务的入口。若估值从 2023 年融资时的 45 亿美元附近上升到 130 亿美元级别,市场定价的就不只是一个代码仓库网站,而是模型分发、数据协作、权重访问、企业部署和开发者网络的基础设施价值。与此同时,出售传闻不能等同于交易已确定,也不能据此推断平台会改变开放政策。更值得跟踪的是潜在买家是否希望把模型仓库、推理服务和云平台绑定,以及社区如何看待治理独立性。
对开源项目维护者,短期仍应按现有许可证、模型卡和服务条款使用,不要因为估值传闻提前迁移或恐慌囤权重;对企业,重要模型和数据应保留镜像、版本锁定与可替代下载路径。若最终发生并购,模型托管平台可能进一步商业化,带来更强的企业 SLA,也可能带来访问策略、隐私和生态中立性的重新评估。
小米展示由玄戒 O3、O100、D100 三颗芯片组成的 AI Cube Prototype,公开报道显示原型机可在本地部署 120B 与 3B 模型,并支持快慢系统切换。
这台设备更像工程原型而非已经可以买到的消费产品,但它释放了清晰的硬件路线:用手机 SoC、专用 AI 加速芯片和智驾芯片组合统一内存与带宽,把大模型推理从云端和独立 GPU 服务器拉回桌面终端。公开报道提到 O3 具备 NPU,O100 强调高带宽 AI 计算,D100 则面向高性能智驾和大容量统一内存;不同媒体对参数和功耗口径略有差异,因此目前应关注架构方向,不宜把宣传规格当成第三方实测。真正决定产品价值的仍是软件栈、模型量化、散热、价格和生态兼容。
如果这类本地 AI 主机最终能以合理价格交付,它会给企业内网、隐私敏感场景和开发者工作站提供云端之外的选择,也会加剧国产芯片与 NVIDIA 统一内存小型工作站之间的竞争。对开发者而言,最值得观察的不是“能不能跑 120B”一句话,而是是否提供稳定的 OpenAI 兼容接口、模型转换工具、调试能力和长期驱动支持;在正式产品与实测出现前,适合列入跟踪而非立即采购。