今天的主线不是又一个聊天模型,而是 Agent 正向“可控执行”下沉:Bionic、Managed Agents、LiveKit/Gemma 等把代码、文档、语音和定时任务变成可直接试用的工作流;Kimi K3 与 RoboTTT 则把上下文规模推向模型和机器人。Agent Reach 多源证据补充在本次运行中超时,工具条目均改用推文 + 官方网站/GitHub/文档人工核验,未核实但有新意的线索明确放入🌱,不把猜测写成结论。
今天的主线不是又一个聊天模型,而是 Agent 正向“可控执行”下沉:Bionic、Managed Agents、LiveKit/Gemma 等把代码、文档、语音和定时任务变成可直接试用的工作流;Kimi K3 与 RoboTTT 则把上下文规模推向模型和机器人。Agent Reach 多源证据补充在本次运行中超时,工具条目均改用推文 + 官方网站/GitHub/文档人工核验,未核实但有新意的线索明确放入🌱,不把猜测写成结论。
LM Studio 新推出的独立桌面 Agent,可调用本地或云端开放模型处理代码、研究、文档、PDF、演示文稿和表格,并提供本地语音转录。
先从官网下载安装 Bionic,注意它是独立于传统 LM Studio 模型浏览器的新应用;启动后新建 Code project,选择一个本地代码目录,让 Agent 先解释项目结构,再要求它只修改一个小问题并逐项检查 inline diff。处理资料时新建 Work project,拖入 PDF、文档或表格,让它先列出引用依据,再生成摘要或初版文件;模型选择上,简单任务先用本地模型,复杂任务再切换 Secure Cloud。还可以从任意应用唤起 Bionic 的 voice keyboard,用本地语音转录输入提示词。
它把“本地模型运行时”和“真正执行工作”的 Agent 层分开,既保留开放模型的可替换性,也把代码搜索、沙盒文档处理、自动保存和回滚检查点放进同一工作区。官方还明确承诺 Bionic 用户零数据留存且不使用数据训练,适合对隐私、成本和模型控制都有要求的个人开发者。
推文展示 Raven 已能启用 deep_research,把复杂开放问题交给 MiroThinker 做更广泛搜索、多来源交叉验证,并返回带引用的研究报告;MiroThinker 官方仓库同时提供开源代码和在线入口。
先打开 MiroThinker 在线入口,选择一个需要比较多个来源的问题,不要只问“总结某主题”,而是明确时间范围、候选对象、必须核验的指标和输出格式;让它先给出检索计划,再检查每条结论后面的来源。若你已经在 Raven 中使用 Agent,按推文所示启用 deep_research,把同一个问题跑一遍并对照引用质量。需要自托管或二次开发时,克隆官方仓库,按 Quick Start 准备环境和模型/API 配置,先用一个小型事实核查任务验证工具调用、引用和失败重试,再扩大到长报告。
它的价值不在“把搜索结果拼成摘要”,而在把搜索、证据交叉验证和报告生成组织成可追踪的研究流程。官方仓库明确将 MiroThinker 定位为面向复杂研究与预测的 deep research agent,并提供模型、评测、在线试用和开源实现,适合拿来测试开放模型在长链路研究中的可靠性。
LiveKit Inference 将 Gemma 4 31B 作为面向实时语音 Agent 的推荐模型,通过统一接口接入 STT、LLM、TTS,官方文档给出了 Python 和 JavaScript 的会话配置方式。
先注册 LiveKit Cloud 并按文档创建项目,再用 Python 或 Node.js 安装 LiveKit Agents SDK;在 AgentSession 中把 LLM 模型设为 google/gemma-4-31b-it,同时配置一个可用的 STT 和 TTS,先运行官方 hotel receptionist 示例。接着只改一个变量,比较 Gemma 4 与你原来的模型在首字延迟、打断恢复、工具调用和完整通话时长上的差异;确认链路稳定后,再把业务函数作为工具接入。不要只看离线文本评测,必须在真实语音轮次中记录端到端延迟、失败率和每分钟成本,并检查是否需要开启额外的观测数据留存。
官方把它定位为由 LiveKit 基础设施托管的延迟优化开放权重模型,且 LiveKit Inference 默认零数据留存,提示词、音频和输出不会被存储或用于训练。对语音 Agent 来说,模型能力只是一个维度,首字延迟、长系统提示词、工具调用和隐私边界同样决定能否上线。
browser-use/browser-harness 的合并 PR 增加了基于同意的浏览器录制和视频制作流程,包含 browser-harness video init、review、export 等命令,并把录制能力并入项目本身。
先阅读仓库 README 和 PR 中的安全说明,在一个不含真实账号、支付信息或个人资料的测试浏览器环境里安装当前版本;按流程运行 browser-harness video init,准备一个可重复的浏览器任务,再通过 BH_RECORD=1 或项目提供的显式录制入口开始会话。完成操作后先用 browser-harness video review 检查动作、截图、光标和叙事顺序,确认没有密钥、Cookie 或敏感页面内容,再运行 video export 生成成片。录制前要明确获得同意,导出后还要检查凭据脱敏、下载行为恢复和临时标签页清理是否成功。
它把“Agent 做了什么”从日志提升为可审阅的视频证据,同时把录制、编辑、渲染和导出收进浏览器工具链。PR 特别强调 consent、secret redaction、真实点击与因果叙事,适合做产品演示、回归复盘和人机协作审计,但不能把录屏当成默认无风险行为。
一个可安装的开源 Agent Skill 包,把自然语言材料整理成适合截图的编辑风格 HTML 信息卡,并可选输出 PNG。
先克隆仓库或把 skills/editorial-card-screenshot 整个目录复制到你的 Agent skills 目录,不要只拷贝单个 SKILL.md;保留 assets、references、scripts 等配套文件。安装后给 Agent 一段会议纪要、产品介绍或文章,直接提出“使用 $editorial-card-screenshot 制作一张 3:4 信息卡”,并明确受众、标题层级、必须保留的数据和画布比例。先要求输出 HTML 检查内容是否溢出,再要求生成 PNG;如果版面拥挤,减少原文、改成 4:3 或 16:9,而不是让模型机械缩小全部文字。仓库也提供示例和内容适配文档,适合从模板开始迭代。
它不是普通的 Markdown 转图片,而是把内容密度、版式骨架和截图交付封装成可复用技能。仓库目前聚焦 editorial-card-screenshot,支持多种画布比例,并要求安装完整技能包,说明 Agent 的视觉产出正在从一次性提示词走向可版本化、可复用的设计资产。
面向设计工程师的开源技能集合,把动画和界面设计中的经验规则写成 Agent 可执行的审查与改进流程。
在前端项目根目录先运行 npx skills@latest add emilkowalski/skills,安装后重新打开你的编码 Agent;先用 improve-animations 让它扫描整个代码库,不要只贴一段 CSS。让 Agent 按目的与频率、缓动与时长、物理感、可打断性、性能、无障碍和一致性列出问题,再挑一项生成可执行计划。确认计划中的文件、曲线、时长和验收方式后,再让 Agent 实施,最后用真实交互逐个检查进入、退出、悬停和键盘操作。这样可以把“看起来不对”变成可讨论的设计决策,而不是盲目增加动效。
它承认通用编码 Agent 往往缺少品味和领域经验,重点不是替人设计,而是把细微但高频的错误变成结构化审查。官方 README 说明 improve-animations 会先调查整个代码库、输出优先级计划且不直接修改源代码,这种“先诊断、后执行”的边界更适合团队协作和代码评审。
Google 为 Gemini API Managed Agents 增加免费层、max_total_tokens 预算护栏和内置 cron 定时执行,降低了构建可自动运行 Agent 的试用门槛。
https://ai.google.dev/gemini-api/docs/agents ↗
https://ai.google.dev/gemini-api/docs/managed-agents-quickstart ↗
先按 Google AI Developers 的 Managed Agents Quickstart 创建 API 项目和密钥,在最小任务上跑通一个只读 Agent;然后在 agent_config 中显式设置 max_total_tokens,先用较低上限观察任务是否会在合理位置停止,再逐步增加。把搜索、文件读取或业务函数作为单独工具接入,每次只开放完成任务所需的权限。最后再配置内置 cron,让它每天执行一次固定任务,并为失败、超预算和重复执行保留日志。免费层适合原型验证,但仍要监控配额、并发和外部 API 成本,不能因为“免费”就放任 Agent 无限循环。
过去很多 Agent 原型卡在三个问题上:没有低成本试用入口、任务失控会烧钱、周期性执行还要自己拼调度器。Managed Agents 把这三项放在同一套能力里,尤其是 token 上限和 cron 让“可运行”更接近“可运营”;但权限隔离、幂等和失败恢复仍然需要开发者自己设计。
Kimi API 文档显示 Kimi K3 已可通过 OpenAI 兼容接口调用,支持 1M-token 上下文、原生视觉理解、工具调用和面向长周期编程/知识工作的 Agent 场景。
先进入 Kimi API Platform 创建 API Key,并把它放进环境变量 MOONSHOT_API_KEY;使用 OpenAI Python 或 Node.js SDK 时把 base_url 指向 https://api.moonshot.ai/v1,模型名填 kimi-k3。先在 Playground 用同一组长文档测试上下文保持、图片理解和多轮追问,再在脚本中加入工具调用;需要更强推理时按文档尝试 reasoning_effort=max,并给任务加明确的停止条件。做代码 Agent 时先让它只读分析仓库和测试失败日志,确认输出稳定后再开放编辑、执行和部署权限,同时记录输入缓存、输出长度、失败重试和 API 成本。
官方把 K3 直接放在长周期编程、知识工作和深度推理入口,而不是只做聊天展示;OpenAI 兼容格式降低了迁移已有 SDK 的成本,1M 上下文和图像/视频输入则适合把长文档、代码库和视觉反馈放进同一任务。真正的差异仍要用自己的数据集验证,不应只根据社区排行榜下结论。
Google 宣布 NotebookLM 更名为 Gemini Notebook,产品仍保持独立研究工具定位,同时增加安全云端计算机、代码执行和跨 Gemini/Search 的同步方向。
这不是简单换 Logo:Google 官方说明原有 NotebookLM 仍是独立产品,但每个 notebook 将获得安全云端计算环境,可直接写代码并执行数据分析;笔记也会逐步进入 Gemini 应用和 Google Search。产品边界从“基于资料问答”向“带计算能力的研究工作区”移动,名称并入 Gemini 则是在统一入口、账号体系和生态分发。对用户来说,最值得观察的不是品牌是否更顺口,而是代码执行结果能否被来源约束、权限是否隔离,以及跨产品同步后资料边界是否仍然清楚。
研究型 AI 的竞争将从回答质量延伸到资料容器、代码运行、结果复现和生态入口。教育、咨询和分析团队可能减少在笔记、搜索、脚本之间来回搬运的成本,但组织也必须重新审查数据权限、云端执行和 Workspace 合规策略;如果品牌层级继续快速合并,用户教育和产品定位反而可能变得更复杂。
NVIDIA、斯坦福和 UT Austin 发布 RoboTTT,将测试时训练引入机器人策略,把视觉运动上下文扩展到 8K timesteps,并用于长时程装配任务。
RoboTTT 的关键不是简单把更多帧塞进 Transformer,而是让 fast weights 在训练和推理时持续更新,把历史压缩到权重状态中;官方页面称其上下文规模达到现有策略的三个数量级,同时不增加推理延迟。在真实机器人任务上,8K 上下文相对单步基线整体性能提升 87%,并完成了五分钟、十阶段的装配;与 1K 预训练上下文相比,性能提升 62%。这把“上下文长度”从语言模型常见指标变成机器人闭环控制的新缩放轴。
如果这条路线能在更多硬件和任务上复现,机器人训练将更重视长轨迹、在线适应和失败后的自我修正,而不只是单步动作准确率。它也会提高数据采集、仿真、记忆状态和安全评测的要求:系统必须证明自己能利用历史改善行为,同时在干扰、分布外物体和错误累积时保持可控,不能只展示一段成功视频。
Simon Willison 连续讨论领先 AI 实验室是否、以及如何使用用户数据训练模型,并转述了 Google 内部员工对专有代码进入训练数据的担忧。
这组讨论的价值在于把“隐私政策”从营销页上的一句不训练承诺,拉回到开发者真正关心的边界:API 请求、聊天记录、代码、调试日志和企业工作区是否分别处理,默认保留多久,哪些产品线规则不同,以及用户能否得到可验证的选择。当前 X List 中主要是讨论与转述,本日报没有把它当成某家公司已被证实的违规事件;更可靠的做法是逐条阅读服务条款、企业合同和控制台设置,再用不敏感样本验证实际行为。
当模型能力越来越接近生产代码和企业知识库时,数据训练政策会直接影响采购、迁移和架构选型。透明度高的供应商更容易获得高价值工作负载,透明度不足则会推动企业自建网关、脱敏、零保留代理和本地模型;对创业公司而言,清楚记录数据流向本身也会成为销售、合规和事故响应能力的一部分。