今天的主线是“模型能力开始变成可嵌入的工作流”:DeepSeek 把视觉输入接到兼容 OpenAI 的 API,OpenAI 将 Codex 的 Agent Harness 推向产品集成,MiniMax Design 则把多模态创作拆成可并行协作的 Agent 团队。本轮 X List 共抓到 107 条;Agent Reach 多源证据包在约 5 分钟内未生成,以下🛠️项目均改用推文 + 官方仓库/文档/官网人工核验,证据不足的新线索明确降级到🌱或🎯。
今天的主线是“模型能力开始变成可嵌入的工作流”:DeepSeek 把视觉输入接到兼容 OpenAI 的 API,OpenAI 将 Codex 的 Agent Harness 推向产品集成,MiniMax Design 则把多模态创作拆成可并行协作的 Agent 团队。本轮 X List 共抓到 107 条;Agent Reach 多源证据包在约 5 分钟内未生成,以下🛠️项目均改用推文 + 官方仓库/文档/官网人工核验,证据不足的新线索明确降级到🌱或🎯。
DeepSeek 的实验性视觉模型,可在文字请求中加入图片,用于读截图、理解图表、提取图片文字或让多模态 Agent 处理视觉输入。
先打开官方 Vision 文档申请并配置 DeepSeek API Key,再用 OpenAI SDK 或兼容的 HTTP 客户端把 base_url 指向 https://api.deepseek.com,模型名填 deepseek-v4-flash-vision-exp。第一次建议用一张本地截图转成 base64,或提供一个可公开访问的图片 URL,在同一条 user 消息里写“提取表格并指出异常项”;随后再试 Files API 的 file_id 复用同一张图。跑通后可把它接到截图审查、票据识别、图表问答或视觉网页 Agent 的工具链里,注意按官方文档检查格式、大小和请求体限制。
它的价值不只是“又一个能看图的模型”,而是把视觉输入放进了 OpenAI-compatible Chat Completions、Responses 和 Anthropic-compatible 调用路径,开发者可以沿用现有 SDK、工具调用与 Agent 编排代码。视觉能力以独立实验模型上线,也便于在不改动纯文本主链路的情况下做 A/B 测试。
OpenAI 开源的 Codex 运行时层,围绕上下文、工具调用、沙箱/审批、进度事件和持续会话,为把 coding agent 嵌入业务软件提供基础组件。
先按官方 README 在 Mac 或 Linux 安装 Codex CLI,例如使用 npm 安装 @openai/codex,启动 codex 并完成登录,先熟悉它如何读取项目、调用工具和请求审批。接着阅读 Codex 的 platform 文章与 app-server 文档,把“执行一次任务”与“持久线程、流式事件、审批处理”分开设计;最小实验可以是做一个内部工单页面,让用户提交任务、Agent 在受限目录修改代码、页面展示进度并要求人工批准高风险动作。确认权限边界和日志记录后,再接入 CI、运维后台或客服系统。
很多 Agent 产品失败并不是模型不会回答,而是缺少上下文管理、工具循环、失败恢复、审批和可观察性。Codex Harness 把这些围绕模型的执行机制公开出来,开发者可以复用成熟的 agent loop,而不是从零拼一套“提示词 + shell 脚本”;这也使 Agent 从独立聊天窗口变成可嵌入的业务能力。
MiniMax 的 AI-native 创作平台,把文案、图片、视频、音频与剪辑串成一个端到端 Agent 工作流,并支持并行的专业 Agent 协作。
打开官方 MiniMax Design 页面并下载桌面端,按提示登录后连接一个本地素材目录。不要一上来只让它“生成一张图”,可以给一个完整 brief,例如“为新品做一条 20 秒电商短片”,再观察主 Agent 如何拆分文案、画面、视频时间线和音频任务。逐步替换参考图、品牌约束和交付规格,在关键检查点人工确认方向,最后检查素材、字幕、配音和成片,再把有效的步骤整理成可复用 Skill。先用低风险的宣传片或短剧片段测试,再迁移到真实项目。
它把多模态模型的能力组织成可检查的生产流程,而不是把图片、视频和音频工具孤立地堆在一起。官方页面强调 Agent 能理解创作意图、编排多种模型、在关键节点等待指令,并支持本地文件和可复用 Skills;对内容团队来说,真正的增量是把策划到交付的协作界面统一起来。
一个面向 Codex 的开源 Skills 插件,分别负责把真实经历生成 HTML/PDF 履历,以及把 Owner、指标、Scope 和时间线拆成证据矩阵审计。
先打开仓库 README,按其中的提示让 Codex 安装插件并启用 asu-resume-skill 与 asu-resume-audit-skill;然后新建对话,提供自己的简历、项目材料和可公开核验的学校/公司信息。先调用生成 Skill,让它输出来源映射、技术链、模块级 Owner 和 HTML/PDF;再调用审计 Skill,逐条检查“核心作者”“0→1”“最大规模”和指标分母。把内部链接、电话、邮箱和未授权材料先脱敏,审计发现证据不足时补充设计文档、代码记录或看板,不要把团队成果直接写成个人成果。
它把简历写作从“把话说大”改成“主张—证据—边界”的流程,尤其强调角色强度、个人归因、指标口径和已交付/规划中的时态区别。对于技术管理者、求职者和做招聘核验的人,这类结构化审计比单纯润色更能降低夸大、误归因和无法复核的问题。
Cursor 官方 Marketplace 中的一组开发 Skills,包含极严格的可维护性审查、Playwright 冒烟测试和基于新证据验证主张等工作流。
https://cursor.com/marketplace/cursor/cursor-team-kit ↗
https://github.com/cursor/plugins/tree/46125561306434d8a1d7745d540d8932ab0cd2a2/cursor-team-kit ↗
打开官方 Marketplace 的 Cursor Team Kit 页面,先安装团队包,再从小范围任务开始试用 `thermo-nuclear-code-quality-review`。给它一个近期改动较多的模块,要求只做审查、不直接改代码,先看它列出的巨型文件、抽象层、条件分支和可维护性问题;随后用 `run-smoke-tests` 跑关键页面或接口的 Playwright 冒烟测试,最后用 `verify-this` 对一条重要修复结论要求基线、处理后产物和明确的 VERIFIED/NOT VERIFIED 结果。将这些步骤写入团队 PR 模板,避免把“Agent 说已修复”当成测试通过。
这套 Skill 的重点不是让模型写更多代码,而是把审查、测试和证据验证变成可重复的质量闸门。它把“代码能跑”与“代码可维护、行为已验证、结论有新证据”区分开,对多人协作和 Agent 高频改动尤其重要,也适合作为现有 CI/PR 流程的人工复核层。
Anthropic 的官方学习平台,覆盖 Claude 产品、Claude Platform、API、工具调用、RAG、Agent 和 MCP 等课程与教程。
进入 Claude Academy 后先从 Claude Platform 101 开始,不要直接跳到 Agent 课程;按课程中的示例完成一次 API 调用,再做一个带工具调用的小练习。随后进入 Building with the Claude API 路径,依次试 Prompt、Tool use、RAG、Agents 和 MCP,每学完一节都把示例改成自己的小任务,例如读取本地知识库或调用一个天气工具。把课程中的请求、权限、错误处理和评估步骤保存成项目笔记,最后再阅读 Claude Code 或 Agent SDK 的官方资料,避免只记住提示词而忽略生产环境的边界。
它不是单纯的产品宣传页,而是把从“会聊天”到“能构建和评估 Agent”的学习路径公开化。课程将 API、工具、RAG、Agent 和 MCP 放在同一条进阶链路上,适合用来建立团队共同术语和最低实践标准,也能减少开发者只凭碎片化帖子拼接架构的成本。
Modular 的开源仓库,同时包含 Mojo 语言和 MAX Framework 的组件,可用于了解 AI 加速库、模型管线和 OpenAI-compatible 推理服务。
先克隆或浏览 Modular 官方仓库,按个人目标二选一:想学 Mojo 就从语言 quickstart 和示例开始,想体验模型部署就打开 MAX quickstart。先运行一个最小示例,记录模型输入输出、依赖和硬件要求,再查看仓库中的 `max/python/max/serve`、模型 pipelines 与 accelerator kernels 目录,理解服务、图和底层算子的关系。不要一开始就改编译器;可以先修改一个示例或标准库相关小模块,跑完官方测试后再比较本地部署和 API 服务的延迟、吞吐与资源占用。
它把语言、编译器生态、加速库、模型架构和推理服务放在同一个可阅读的开源平台里,适合观察“模型研发”和“部署基础设施”如何衔接。官方 README 还明确区分了 Mojo 与 MAX 的入口及许可证边界,学习者可以从可运行 quickstart 逐步深入,而不是只看概念介绍。
Anthropic 社区插件仓库中的一个极简 Skill,接收 `/eli5 <topic>`,要求用面向零基础读者的 HTML artifact 解释主题。
先阅读仓库中的 SKILL.md,按 Claude Code 社区插件的方式启用对应 Skill;如果只想快速试验,也可以把文件内容放进自己的 skills 目录并重新加载 Skill 列表。然后输入 `/eli5 向五岁孩子解释 MCP` 或换成一个团队内部术语,要求输出 HTML artifact。检查生成结果是否真的少术语、有层级、有图示或大字号结构;如果内容仍像论文,就继续收紧受众、限制段落长度,再把效果好的版本用于 onboarding、产品宣讲或课前预习。
它的代码几乎只有一条核心提示词,却展示了 Skills 的一个重要方向:把稳定的表达规范封装成可复用入口。它不追求复杂编排,适合用来快速验证 Skill 的安装、参数传递和 HTML 产物链路,也提醒使用者不要为了偶尔一次的简单提示而堆叠不必要的插件。
Anthropic 发布《Claude Code guide for startups》,基于对十多家快速成长公司的访谈,总结“人人交付、自动化琐事、信任但验证、为重建而构建、原型—试用—生产化”五条原则。
这份材料的意义不在于再宣传一个编码助手,而在于把 Agentic Coding 从个人效率技巧提升到组织运行方式。它强调所有人都参与交付、把重复劳动自动化,同时保留验证和重建机制,说明真正的瓶颈正在从“模型能不能写代码”转向“团队如何定义上下文、验收标准、责任边界和反馈闭环”。对小团队而言,先把一个完整流程跑通往往比同时采购多个 Agent 更重要。
如果这套方法被更多初创公司采用,工程岗位的分工会更接近产品、验证和系统编排,代码产量不再是唯一指标。企业也会更重视权限、测试、可回滚和知识沉淀;能把 Agent 接入真实交付链路的团队,可能比只在聊天窗口里生成代码的团队更快形成差异化。
飞猪推出“飞猪帮帮”,把自然语言旅行规划延伸到机酒预订、退改、值机选座、升房、接送机、入境卡和开票等履约任务,并同步开放面向旅行应用的 AI 能力。
旅行场景最难的部分不是生成一份漂亮攻略,而是把用户意图映射到实时库存、订单、规则和异常处理。飞猪帮帮的产品路径说明垂直 Agent 的竞争点正在从“回答得像不像人”转向“能否在授权后真正完成事务”。对于其他行业,关键启发是先寻找可验证的交易或业务动作,再围绕身份、权限、库存、人工接管和失败补偿设计 Agent,而不是只做一个通用问答入口。
一旦旅行 Agent 能稳定处理预订和售后,OTA 的入口、搜索和客服边界都会被重新划分,用户可能从浏览多个页面变成直接提出目标。产业上,这会抬高数据、交易系统和行业规则的整合门槛,也让“接入真实供给”和“对结果负责”成为 Agent 产品的核心护城河。