今天的主线不是单一模型刷榜,而是“模型可切换、Agent 能交付、能力开始下沉到本地与真实工具”:DeepSeek V4 Pro 0813、Grok 4.6、端侧模型和视频 Agent 同时进入可操作阶段。说明:本轮 Agent Reach 多源证据包在限时内未产出,以下🛠️条目均用本次 X List 推文加官方官网、GitHub、模型卡或文档人工交叉核验;证据不足的新线索已放入🌱并标注“证据待补”。
今天的主线不是单一模型刷榜,而是“模型可切换、Agent 能交付、能力开始下沉到本地与真实工具”:DeepSeek V4 Pro 0813、Grok 4.6、端侧模型和视频 Agent 同时进入可操作阶段。说明:本轮 Agent Reach 多源证据包在限时内未产出,以下🛠️条目均用本次 X List 推文加官方官网、GitHub、模型卡或文档人工交叉核验;证据不足的新线索已放入🌱并标注“证据待补”。
DeepSeek 新一代 Pro API,兼容 OpenAI 与 Anthropic 调用方式,适合长上下文推理、代码和 Agent 工具调用。
先在 DeepSeek API 控制台申请 Key,把 `DEEPSEEK_API_KEY` 写入环境变量;如果已有 OpenAI SDK,只需把 base_url 改成 `https://api.deepseek.com`,model 改为 `deepseek-v4-pro`,就可以先跑一条普通对话,再打开 thinking 和 tool calls。需要兼容 Anthropic 工作流时,把入口切到 `https://api.deepseek.com/anthropic`,用同一组业务提示词分别测试代码修复、网页资料整理和函数调用。建议同时记录首 token 延迟、总耗时、输入缓存命中率和工具失败率,不要只看一次生成结果。
官方文档已经给出 OpenAI/Anthropic 双兼容入口、工具调用和 1M 上下文等工程接口,意味着它更容易被接入现有 Agent,而不是只能在聊天网页里试用。对需要控制成本的团队,缓存命中与并发限制也比单纯比较榜单更值得实测。
SpaceXAI 与 Cursor 联合推出的新模型,已进入 Cursor、Grok Build、API 和 CLI,可用于代码、研究与长程 Agent 任务。
想最快体验,直接打开 Cursor 更新到可用版本,在模型选择器中选 Grok 4.6,拿同一个小项目连续做“读代码—改功能—运行测试—修复失败”四步任务;想脱离 IDE,则按 xAI CLI 页面安装命令安装 Grok Build,再在一个真实代码仓库中执行一次需求拆解。若要接入自己的程序,申请 xAI Key 后调用 `grok-4.6`,把同一提示词分别跑普通问答、代码修改和视觉交互任务,并保存 diff、测试结果和 token 成本。
它的价值不只在模型分数,而在同一模型被同时放入 IDE、CLI、API 和构建工具,降低了从“试模型”到“交付代码”的距离。Cursor 官方还提供了首周额外用量,适合用固定任务做横向对比,但必须注意随机性与套餐限制。
Meta 开源的 30B 本地 Agent 模型,Apache 2.0 许可,面向工具调用、长任务、编码和失败恢复。
https://developer.meta.com/ai/models/muse-glimmer/ ↗
先打开官方模型卡确认下载权限和硬件条件,再选择 Transformers、llama.cpp、MLX 或其他已支持后端。最省事的路径是使用官方或社区 GGUF,在新版 llama.cpp 中拉取模型并启动本地服务;如果要做 Agent,给模型一个只读文件检索或本地命令工具,先跑“列出目录—读取文件—给出修改计划”,再逐步开放写入权限。用同一组任务比较 2/4/8 bit 量化的速度、内存、工具调用格式和失败恢复,不要把本地推理能力等同于生产级安全性。
它把“能做工具调用的模型”与“能在个人硬件上常驻运行”结合起来,Apache 2.0 也给本地隐私、离线编码和定制部署留下空间。官方同时提供 Hugging Face、llama.cpp 等入口,生态接入成本相对清晰。
面向 AI 编码的原生 macOS 快速终端,内置 AI 助手、命令生成、错误恢复和多种编码工具配置。
macOS 用户可以从 GitHub Releases 下载 DMG 拖入 Applications,也可以执行 `brew install tw93/tap/kakuku`;安装后运行 `kaku doctor` 检查 PATH 和 Shell 集成。打开 AI 配置页,选择自己的模型认证方式,分别配置简单模型和深度模型;在终端里用 `#` 加自然语言描述生成命令,先审阅再执行。再开两个标签和窗格,尝试把标签拖出为独立窗口,配合 Claude Code、Codex 或其他 CLI,观察跨显示器、重启确认和错误修复是否符合自己的工作习惯。
Kaku 不是把 AI 聊天框贴在终端旁边,而是把命令生成、失败修复、编码工具配置和原生窗口体验放到同一工作面。它基于 WezTerm 深度定制,开源、无需账号,适合想把 AI 编码工作流留在本机的人。
Lightricks 的开放权重音视频生成模型,支持文本/图像到视频、同步音频、微调和本地部署。
先克隆官方仓库并创建独立 Python 环境,再按 README 用 Hugging Face CLI 下载 LTX-2.5 的 distilled transformer、文本编码器、视频 VAE 和音频 VAE;显存有限时先选择 distilled 组件和较低分辨率。跑通官方最小示例后,再尝试文本生成短片、图像到视频和带参考条件的镜头连续性。把输出视频和音频分别检查,重点观察口型、环境声、镜头切换和提示词遵循;要做产品原型,可进一步研究 LoRA trainer、ComfyUI 对齐组件和桌面版,而不是一开始就下载全部权重。
它把视频与同步音频放在同一开放权重路线中,允许团队自托管、微调和接入现有流水线。组件化权重也意味着可以按任务选择下载内容,减少把整个模型当黑盒 API 使用的锁定。
Black Forest Labs 的多模态视频模型,支持文字生视频、图生视频、视频续接以及同步音频。
先在 Black Forest Labs Dashboard 注册并准备 API Key,或直接使用网页 Playground 体验。第一次建议从 `t2v` 文生视频开始,只写一个 5 秒镜头;第二次用 `i2v` 固定首帧,第三次用 `v2v` 给已有片段续写,分别记录镜头一致性和音频效果。开发者可以参照文档向 `https://api.bfl.ai/v1/flux-3-video` 提交异步任务,再轮询 polling URL 下载结果。把 `duration`、`resolution`、`generate_audio` 和关键帧组合成自己的测试矩阵,注意结果链接有过期时间,生成后要及时保存。
FLUX 3 的工程亮点是同一个请求形状覆盖多种视频起点,并原生生成同步声音;多镜头、关键帧和续接比单次炫技更接近制作流程。它同时提供 Playground、API 和开放权重方向,适合从试玩逐步过渡到集成。
ShipAny 面向视频 Agent 的现成模板,用对话、多步骤工具调用和多模型适配快速搭建视频生成 SaaS。
https://shipany.ai/zh/templates/video-agent ↗
https://docs.shipany.ai/en/ai-integrations/video-generation ↗
先打开官方模板页确认模板版本和授权方式,再取得代码后按文档配置数据库、认证、支付/积分和视频模型 Provider。建议先用一个最小产品名启动,运行模板自带的登录与生成流程;然后把用户输入拆成“脚本—分镜—素材—生成—预览”五步,让 Agent 在每步产出结构化 JSON,并给用户一个确认点。接着只接入一个视频模型跑通端到端,再逐步添加第二个 Provider、任务队列、失败重试和成本上限,最后再做品牌和 SEO,而不是一开始改大量页面。
它把 AI 视频应用中最费时间的账号、支付、积分、配置和模型调用骨架提前准备好,重点从“能不能生成视频”移向“能不能交付一个可运营产品”。官方文档还给出自定义 Provider 和 `generateVideo` 调用方式,便于做二次开发。
Mac 上的原生绘图与图片编辑工具,支持图层、矢量对象、照片编辑,并提供本地 Automation/MCP 集成。
从官网下载安装后,先用 File → New 建一个文档,分别试用 Paint 和 Vector 起始图层,保存为原生 `.dsimp` 文件,确认图层、矢量对象和编辑状态可以再次打开。然后导入一张截图或照片,做裁剪、文字、形状和简单效果;如果要接 Agent,先阅读 Automation/MCP 说明,只开启本机服务并设置访问权限,让 Claude Desktop、Claude Code 或自写 Python 脚本创建文档、添加形状、导出 PNG。建议先做无敏感数据的批处理,逐项验证撤销、导出和权限边界。
它把本地图片编辑和 Agent 可调用的桌面自动化放到一个轻量原生应用里,不需要把图片上传云端才能完成基础操作。对 macOS 用户来说,原生图层、矢量和本地 MCP 比单纯的在线生成器更适合做可复用工作流。
面向 AI Agent 的网页幻灯片生成 Skill,可生成杂志风、瑞士风布局、配图提示和可交互的 HTML Deck。
先把仓库安装到自己使用的 Agent Skill 目录,阅读 README 和示例,再准备一份 3—5 页的短文档作为输入。让 Agent 先输出叙事大纲和页面清单,确认信息层级后再调用 PPT Skill 生成 HTML;生成后用浏览器逐页检查字体、图片比例、移动端滚动和 WebGL/动画性能。需要线下分享时,再用配套转换工具导出 PDF 或 PPTX,并人工检查字体嵌入、分页和中文断行。最后把自己的品牌色、封面比例和常用布局写入配置,形成可重复的演示流水线。
它不是单一提示词模板,而是把视觉叙事、页面布局、图片提示和运行时组合成可复用 Skill。HTML 作为中间产物便于 Agent 继续修改,也更适合快速迭代网页式演示和社交媒体卡片。
微信公开 WeLM 两个版本,并将轻量激活的模型能力放进原生 AI 助手“小微”的产品链路。
本次信号的重点不只是总参数量,而是模型直接进入微信原生助手和小程序调用场景。公开信息显示,WeLM-80B 总参数约 800 亿、激活参数约 30 亿;WeLM-617B 总参数约 6170 亿、激活参数约 230 亿。对用户而言,模型不一定以独立聊天机器人出现,而可能隐藏在消息、搜索、服务和小程序流程里,模型负责理解意图,产品负责调用真实功能。
这会把大模型竞争从“谁的网页聊天更强”推向“谁能在超级应用里完成更多动作”。如果调用权限、隐私隔离和失败回退做得好,轻量激活模型能同时兼顾成本与规模;但模型是否真的稳定完成跨应用任务,还要等待公开 API、评测和更长时间的用户反馈。
前千问技术负责人林俊旸宣布在上海成立 Pragmatik Labs,研究横跨数字世界与物理世界的下一代 Agent。
公开资料显示,这家公司的方向包含数字 Agent、物理 Agent、从研究到产品以及长程探索,投资方包括高榕创投、HSG、腾讯和上海未来产业基金。它释放的行业信号是:大模型核心人才的下一站,正在从继续堆训练规模转向研究模型如何调用工具、适应环境、从反馈中学习并持续完成长期任务。数字工作流和具身智能被放进同一家公司,也说明两者可能共享规划、记忆、反馈和协作等底层方法。
如果这条路线成立,未来的竞争单位会从单个模型变成“模型+环境+工具+评测+协作”的完整系统。对创业公司和开发者而言,机会不只在训练新模型,也在垂直环境数据、长任务评测、真实世界反馈和安全执行层;但目前公司尚未公布具体产品与模型,不能把融资和方向公告当成技术落地结果。
Manus 宣布将从 Meta 交易的后续安排中恢复独立运营,并提醒部分用户在 8 月 23—24 日完成数据备份与恢复流程。
Manus 官方说明,独立运营与特定司法辖区的监管要求相关,部分用户在 2025 年 12 月 29 日之后生成的数据可能需要删除;受影响用户应在 8 月 23 日前备份,并在 8 月 25 日起恢复。这个事件值得关注的不是品牌归属本身,而是 AI Agent 服务开始同时面对云端执行、用户数据、跨境合规和业务连续性问题。一个能创建虚拟电脑、长期运行任务的 Agent,数据治理会直接成为产品体验的一部分。
Agent 产品未来不能只用模型能力和任务成功率衡量,还要把账号迁移、数据可导出、权限撤销、区域存储和故障恢复纳入设计。对企业用户来说,选择 Agent 平台时应提前询问数据生命周期、备份格式和服务中断预案;对厂商来说,透明说明和可操作的迁移工具会成为信任与留存的关键。