作者: 颠倒梦

  • Gemini 3.5 Pro迟到数月

    Gemini 3.5 Pro迟到数月

    谷歌最强旗舰模型Gemini 3.5 Pro据称已延期数月,编码能力未达预期只是表层原因,人才流失、组织内耗与军方合作争议正在同时拖慢DeepMind。

    谷歌的下一代旗舰模型,仍然没有等来发布日期

    截至北京时间 2026 年 7 月 24 日,谷歌尚未发布被视为下一代旗舰模型的 Gemini 3.5 Pro,而多家媒体援引内部人士称,其开发进度已经落后原计划数月。

    Gemini 3.5 Pro 是谷歌正在开发的新一代高性能通用模型,目标是承担复杂推理、代码生成、多模态理解和企业级智能体任务。 彭博社此前报道称,该模型未能按照原计划推进;Axios 最新采访的六位谷歌 DeepMind 现任及前任员工则表示,员工士气低落、人才流失和内部争议也是延期的重要原因。

    谷歌并未公开确认 Gemini 3.5 Pro 的最终发布日期,也没有发布模型参数、基准测试成绩和正式价格。这意味着,外界目前只能确认旗舰模型缺席,无法通过公开跑分判断它究竟比竞争对手落后多少。

    Gemini 3.5 Pro 的问题已经不只是一次普通跳票,而是谷歌能否维持前沿模型迭代速度的压力测试。 对一家拥有自研 TPU、全球级数据中心、搜索数据和顶尖研究团队的公司来说,算力与资金都不是最稀缺的资源;真正稀缺的是让研究、产品、安全和商业团队在同一时间表下完成交付的组织能力。

    谷歌DeepMind办公楼与Gemini标志,画面中央是一条不断向后延伸的产品发布时间线

    延期数月,编码能力据称是直接瓶颈

    AI 编码能力是指模型理解代码库、生成和修改程序、定位缺陷并完成软件工程任务的综合能力。 它与回答一道算法题不同,更接近让模型进入真实项目,在多个文件、依赖关系、测试用例和运行环境之间连续工作。

    据彭博社此前援引十位现任及前任谷歌员工的报道,Gemini 3.5 Pro 的直接瓶颈之一是编码表现未达到内部预期。谷歌在 6 月底更新了训练数据,希望改善代码生成效果,但内部测试结果据称仍不理想。

    编码能力已经从模型发布会上的展示项目,变成前沿模型最重要的商业入口之一。 企业愿意为代码智能体付费,不是因为它能补全一行函数,而是因为它可以阅读仓库、调用工具、执行测试、修复错误,再根据测试结果继续迭代。这个场景要求模型同时具备长上下文理解、规划、工具使用和低错误率,任何一项短板都会被放大。

    谷歌面临的难题是,旗舰模型不能只在少数榜单上追平对手,还必须在真实软件工程流程中保持稳定。 如果模型生成一段代码的成功率是 90%,看上去已经很高;但一个任务若需要连续完成十个相互依赖的步骤,理论上的全流程成功率只有约 35%。前沿模型厂商因此越来越重视多步执行和错误恢复,而不只是单轮代码生成。

    目前没有公开证据表明 Gemini 3.5 Pro 在某个具体编码基准上落后多少。谷歌没有发布 SWE-bench、Terminal-Bench 或内部软件工程评测数据,媒体报道也没有给出可复核的分数,因此把“落后数月”直接等同于“性能落后几代”并不严谨。

    发布日期的落后仍然会转化为产品层面的落后。 模型晚发布一个月,意味着开发者反馈、企业部署、智能体适配和推理优化也晚一个月;当竞争对手以数周为周期更新时,数月延期足以让对方完成一轮模型、工具链和客户案例的闭环。

    小模型持续更新,反而放大了旗舰缺席

    轻量模型是以较低推理成本和更短响应时间为目标,主动牺牲部分复杂任务能力的模型。 谷歌近期仍在推进 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向网络安全任务的 Gemini 3.5 Flash Cyber,说明 DeepMind 的模型发布管线并未完全停摆。

    小模型能够守住调用量,却无法替代旗舰模型建立技术上限。 Flash 类模型适合高并发客服、信息抽取、内容审核和简单代码辅助,但企业在复杂编程、科研分析和自主智能体场景中,首先比较的仍是各家的最强模型。

    | 模型或产品线 | 当前状态 | 主要定位 | 编码与复杂推理 | 价格信息 | 现阶段判断 | |—|—|—|—|—|—| | Gemini 3.5 Pro | 据称延期数月,尚未正式发布 | 谷歌下一代旗舰模型 | 据报道未达到内部预期,暂无公开跑分 | 尚未公布 | 决定谷歌能否守住第一梯队上限 | | Gemini 3.6 Flash | 已推出或进入市场投放阶段 | 低延迟、高吞吐任务 | 更强调效率,不以最高能力为首要目标 | 以谷歌正式页面为准 | 能补充产品线,不能替代 Pro | | Gemini 3.5 Flash-Lite | 已推出或进入市场投放阶段 | 成本敏感型批量任务 | 适合结构化处理和轻量生成 | 公开资料未在本次报道中统一列明 | 有利于规模化使用,但难承担复杂智能体 | | Gemini 3.5 Flash Cyber | 面向网络安全的专用版本 | 安全分析与相关工作流 | 侧重垂直领域,而非通用能力上限 | 尚无完整可比价格数据 | 场景明确,但市场范围有限 | | OpenAI、Anthropic旗舰模型 | 持续迭代 | 通用推理、编码与智能体 | 已成为谷歌内部比较对象 | 各家计费结构不同 | 在开发者心智和企业编程场景中施压谷歌 | | Meta AI模型体系 | 持续推进 | 模型能力、开放生态及消费级入口 | 竞争重点因产品而异 | 无法与闭源旗舰直接按单一价格比较 | 高管公开嘲讽反映竞争气氛升温 |

    表格中没有填写未经官方确认的基准分数,也没有把不同上下文长度、缓存机制和推理模式下的价格强行换算。模型比较只有在任务、输入输出规模和推理预算一致时才有意义,单看一个总榜名次很容易得出错误结论。

    Meta AI 负责人 Alexandr Wang 已在 X 上用“Gemini?没听说过”公开调侃谷歌,其他竞争对手也在追问更强模型何时就绪。高管间的口水战没有技术含量,但它说明谷歌正在丢失一种更重要的资产:市场默认其下一次发布会带来领先模型的预期。

    技术问题背后,是谷歌式组织内耗

    组织内耗是多个团队在目标、资源和决策权上相互牵制,最终降低整体交付速度的状态。 对谷歌来说,训练出一个强模型只是第一步,模型还要进入搜索、云服务、Android、YouTube、Workspace 和开发者工具,任何一条产品线都可能提出不同的成本、安全与发布时间要求。

    前员工将推动谷歌各部门朝同一方向前进,形容为“把整个海洋的水烧开”。这个比喻并不夸张:Google Cloud、DeepMind 和 Android 团队都在开发面向程序员的 AI 工具,部分消费者产品团队也参与其中,重叠项目会争夺相同的算力、人才和内部渠道。

    重复造轮子的问题不在于谷歌缺少项目,而在于太多项目都希望成为统一入口。 一个团队希望模型优先服务云客户,一个团队要求它与 Android 深度结合,另一个团队则要保护搜索广告的用户体验;这些目标单独看都合理,放在同一发布日期前就会互相冲突。

    内部算力竞争也会拖慢实验节奏。谷歌虽然拥有自研 TPU 和庞大的数据中心,但前沿训练、后训练、评测以及产品推理都在争夺高端计算资源;当研究人员无法快速重复实验时,训练数据更新后的负面结果就更难被及时定位。

    谷歌早期对内部代码使用生成式 AI 的谨慎政策,也可能让它错过了一部分产品反馈窗口。 出于专有代码保护和训练数据治理考虑,谷歌一度限制员工用 Gemini 编写或分析内部代码,相关政策后来有所放宽,但组织级使用习惯不会随着一条政策立即改变。

    联合创始人谢尔盖·布林一直在推动 AI 编程产品提速,谷歌首席 AI 架构师 Koray Kavukcuoglu 也在尝试统一内部工具,DeepMind 还组建了专门的 AI 编程团队。这些调整方向是对的,但组织重构的见效周期通常比模型训练周期更长,难以立刻解决 Gemini 3.5 Pro 的发布时间问题。

    军方合作争议正在消耗员工士气

    谷歌与美国国防部的合作协议,是本轮 DeepMind 员工不满的另一条导火索。 据 Axios 报道,谷歌在 2026 年 4 月达成了一项允许美国军方使用其技术的协议,多名员工在离职面谈中提到了这项合作。

    一位知情人士将内部争议描述为一场“持续的战斗”,并称其造成了“情感上的倦怠”。DeepMind 前研究科学家 Alex Turner 也表示,自己因谷歌的军事合同而辞职。

    军事合作争议对模型进度的影响不是某段训练代码突然失效,而是团队信任和人员稳定性下降。 前沿模型项目高度依赖经验积累,负责数据、架构、评测和后训练的核心研究员很难被即刻替代;一个关键成员离开,可能让多个实验失去上下文。

    DeepMind CEO Demis Hassabis 最近发布了新的 AI 安全框架,但有前员工认为,他在公司内部的可见度不如部分竞争对手 CEO。安全框架能够明确模型风险边界,却不能自动解决员工对技术最终用途的道德分歧。

    谷歌曾因 Project Maven 等军事项目遭遇过类似内部反弹,因此这并不是一个全新的管理问题。不同之处在于,2026 年的顶尖 AI 人才拥有更多选择,研究员可以转向 OpenAI、Anthropic 或其他资金充足的实验室,员工不满更容易迅速变成人才流失。

    顶尖研究员离职,比一次延期更难修复

    人才流失是谷歌当前最具长期破坏性的风险。 据相关报道,Gemini 联合负责人 Noam Shazeer 已离开谷歌并加入 OpenAI,AlphaFold 核心研究者、诺贝尔化学奖得主 John Jumper 则转投 Anthropic。

    今年 6 月,Gemini 核心研发人员 Jonas Adler 和 Alexander Pritzel 也被报道离职并加入 Anthropic。这些人员变动的重要性不只体现在履历,而在于他们掌握模型训练过程中大量不会完整写入文档的隐性知识。

    前沿模型开发不是按人数线性扩张的工程。新增十名研究员未必能立刻替代一名熟悉训练失败模式、数据配比和评测漏洞的核心成员;新员工需要先理解已有实验,再建立对内部基础设施的判断,补位周期往往以月计算。

    人才流动还会形成自我强化。 当研究员认为项目落后时,更容易接受竞争对手邀请;核心人员离开后,剩余团队的负担加重,模型进度进一步受影响;进度继续延误,又会让更多人怀疑项目方向。

    1900亿美元支出,让延期变成财务问题

    AI 资本开支是科技公司为数据中心、芯片、网络和电力基础设施投入的长期资金。 谷歌最新一季财报超过市场预期,但报道指出,公司自由现金流已经转为负值,重要原因之一正是持续增加的 AI 投资。

    谷歌 2026 年总支出预计达到 1900 亿美元。这个数字不应被简单理解为全部用于训练 Gemini,也不应与单一季度资本开支混为一谈,但它足以说明市场对投资回报的要求正在迅速提高。

    彭博行业研究分析师 Mandeep Singh 表示,谷歌云业务收入增长 82%,搜索业务收入则略低于华尔街预期。云业务高增长证明 AI 基础设施确实存在需求,但搜索低于预期会放大投资者对核心业务被 AI 改写的担忧。

    | 财务与业务指标 | 最新报道口径 | 对 Gemini 3.5 Pro 的含义 | |—|—:|—| | 谷歌 2026 年预计总支出 | 1900 亿美元 | 模型延期会加大市场对投入效率的质疑 | | 谷歌云业务收入增速 | 82% | AI 计算需求强劲,基础设施仍具商业回报 | | 自由现金流 | 已转为负值 | 投资者将更关注模型和产品何时兑现收入 | | 搜索业务表现 | 略低于华尔街预期 | 谷歌必须证明 Gemini 能增强而非侵蚀搜索业务 |

    Alphabet 股价此前也对延期报道作出明显反应,相关消息出现后盘中一度跌逾 3%,当日最终收跌 4.44%。股价波动不能证明一个未发布模型的能力,但能反映资本市场已经把 Gemini 3.5 Pro 当作衡量谷歌 AI 执行力的指标。

    谷歌还没有掉队,但容错空间正在缩小

    谷歌仍然拥有其他实验室难以复制的全栈优势。 从 TPU、数据中心到搜索、Android、Chrome、YouTube 和 Workspace,谷歌可以把模型同时部署到消费端、企业端和开发者端,并通过真实产品获得高频反馈。

    Gemini 在多模态输入、搜索信息整合和超大规模分发方面仍有明显基础,谷歌云的增长也说明企业没有停止购买其 AI 基础设施。下一代 Gemini 4 据称已经启动训练,因此 Gemini 3.5 Pro 延期并不等于谷歌的前沿模型路线中断。

    谷歌真正落后的可能不是某一项模型能力,而是把研究成果变成稳定产品的速度。 OpenAI 和 Anthropic 的组织更聚焦,可以围绕单一模型快速调整产品和商业策略;谷歌每次升级都必须考虑多个业务部门以及数十亿用户的兼容问题。

    谷歌选择不发布一个内部评测不过关的旗舰模型,本身并不是错误。相比带着明显缺陷仓促上线,延期并继续训练通常更负责任,尤其是旗舰模型会直接进入企业代码库和自动化工作流。

    延期的合理性取决于它最终换来了什么。 如果 Gemini 3.5 Pro 上线后在真实编码、复杂推理和智能体执行上形成可感知优势,几个月等待可以被视为质量控制;如果模型只是在公开榜单上小幅追平对手,延期就会被解释为组织效率下降。

    对开发者而言,当前不应为未发布模型暂停选型

    开发者现阶段不应根据传闻为 Gemini 3.5 Pro 预留关键项目档期。 模型尚无确定发布日期、正式价格、上下文规格和可复核跑分,任何围绕它制定的迁移计划都缺乏稳定依据。

    企业更合理的做法是使用自己的真实任务集持续评估现有模型。代码场景至少应覆盖仓库级理解、跨文件修改、测试通过率、工具调用成功率、响应延迟和单任务总成本,而不是只比较厂商提供的静态榜单。

    谷歌需要用正式发布回答三个问题:模型是否足够强、推理是否足够稳定、价格是否足以支撑规模化部署。 其中任何一个问题没有清晰答案,Gemini 3.5 Pro 都很难扭转市场对谷歌“再次掉队”的判断。

    截至 7 月 24 日,最稳妥的结论仍然是:Gemini 3.5 Pro 确实处于外界预期之外的延期状态,但谷歌的技术落后幅度尚无公开数据可以量化。比模型跑分更明确的信号,是人才、组织、文化和资本压力正在同一时间挤压 DeepMind 的交付能力。

    参考来源

    • IT之家:谷歌旗舰大模型难产背后,军方合作引员工不满 —— 汇总 Axios、彭博社报道,涉及模型延期、员工士气、人才流失与谷歌财务数据。
    • 知乎:Gemini 3.5 Pro 难产,谷歌跌入失望陷阱 —— 对 Gemini 3.5 Pro 延期及编码能力瓶颈的补充分析。
  • Genie走进微软办公流

    Genie走进微软办公流

    Databricks 将把 Genie 接入 Microsoft 365 Copilot,让员工在 Teams 等办公入口直接查询企业数据。真正的价值不在聊天界面,而在身份、权限与数据治理能否原样延伸到办公工作流。

    Genie 走进微软办公流:企业数据分析助手不再困在 BI 后台

    Databricks 正在把 Genie 接入 Microsoft 365 Copilot,企业员工未来可以在 Teams 等日常办公入口中,直接用自然语言查询 Databricks 里的业务数据。7 月 23 日,Databricks 宣布将与微软的战略合作延长至 2030 年代,并扩大 Azure Databricks、Microsoft 365、Power Platform、Copilot Studio 以及 Azure Cobalt 之间的整合。

    这次更新的重点不是给 Databricks 再增加一个聊天窗口,而是让数据分析能力进入企业已经在使用的办公工作流。销售负责人不必打开 BI 仪表盘,供应链经理也不必先找到数据分析师,他们可以在 Microsoft 365 Copilot 或 Teams 中直接追问:华东区本周收入为什么下降、哪些 SKU 的库存风险最高、上季度续费率变化来自哪些客户群。

    **Databricks Genie 是一套面向企业数据的自然语言分析助手。**它把用户问题转换为对企业数据的分析过程,并结合数据表、字段、指标定义和业务语义生成回答。与通用聊天机器人不同,Genie 的核心对象不是互联网知识,而是被 Databricks 管理和授权的内部数据。

    Databricks Genie 通过 Copilot Studio 接入 Microsoft 365 Copilot 和 Teams,并连接 Unity Catalog 与企业数据的架构示意图

    不是把数据复制给 Copilot,而是把 Genie 变成可调用的企业 Agent

    这项集成更接近“Agent 调用 Agent”,而不是把 Databricks 数据整体导入 Microsoft 365。Microsoft 365 Copilot 承担用户入口和任务编排,Genie 负责理解数据问题、访问获准的数据资产并返回分析结果,底层数据仍由 Databricks 的数据平台和治理体系管理。

    微软与 Databricks 的官方文档显示,目前有两条主要接入路径:第一条是在 Microsoft Teams 中安装 Databricks Genie 应用,再从 Microsoft 365 Copilot 中选择 Genie;第二条是先从 Databricks 建立到 Microsoft Power Platform 的连接,再通过 Copilot Studio 连接 Genie Agents,并将其发布到相应办公场景。

    **Copilot Studio 是微软用于构建、连接和发布企业智能体的低代码平台。**它在这套架构中扮演编排层,负责把 Microsoft 365 中的用户请求交给 Genie,而不是替代 Genie 的数据分析能力。

    两条接入路径对应不同的企业需求:

    1. **Teams 应用路径更适合快速部署。**企业可以把 Genie 放进员工已经使用的沟通界面,减少切换系统的成本。
    2. **Copilot Studio 路径更适合流程化集成。**企业可以把 Genie 与审批、通知、客户服务或内部知识助手组合,而不只是提供一个独立聊天入口。
    3. **Power Platform 连接更适合已有微软低代码体系的组织。**这类企业通常已经使用 Power Automate、Power Apps 或 Copilot Studio,Genie 可以成为其中一个受控的数据分析节点。

    这也意味着,所谓“接入 Microsoft 365”并不等于 Genie 立刻成为 Word、Excel、Outlook 中无处不在的原生按钮。现阶段官方明确描述的主要交互入口是 Microsoft 365 Copilot、Teams 应用以及通过 Copilot Studio 发布的 Agent;企业能否在具体 Office 应用中调用,还取决于管理员配置、租户策略、产品许可与微软侧的功能开放范围。

    最关键的变化是权限可以跟着用户走

    企业数据助手真正难解决的问题不是自然语言转 SQL,而是“谁有权问什么”。一个能回答收入、员工薪酬、客户名单和供应链成本的机器人,如果只用统一服务账号访问数据库,就可能把原本隔离的数据暴露给不该看到的人。

    **企业 OAuth 是将用户身份和授权关系带入外部应用的企业级认证机制。**Databricks 表示,Genie 可以通过企业 OAuth 对来自 Teams、Copilot Studio 或自定义应用的会话进行认证,让每次对话对应到具体用户,而不是让所有请求共享一个高权限账号。

    **Unity Catalog 是 Databricks 用于统一管理数据、AI 资产、权限和审计的治理层。**Genie 会遵循用户已有的 Unity Catalog 权限,只访问该用户能够访问的数据;如果一名区域经理没有查看全国客户明细的权限,把问题换成自然语言也不会自动绕过限制。

    这套身份链路至少要完成四件事:

    • Microsoft 365 能识别当前发起请求的员工;
    • Copilot Studio 或 Teams 应用能够把身份安全地传递给 Databricks;
    • Databricks 能依据该身份执行对应的数据权限;
    • 查询、回答和工具调用能够进入企业审计记录。

    权限继承是这次集成最有价值、也最容易被低估的部分。过去企业把聊天机器人接到数据库时,往往需要重新开发登录、权限映射、凭证保管和审计逻辑;如果 OAuth、Copilot Studio 与 Unity Catalog 能完整衔接,部署团队可以少造一套身份系统。

    但权限正确不代表答案正确。Genie 即使只能看到获准的数据,仍可能因为指标定义含糊、表之间关系错误、数据更新延迟或自然语言歧义,给出逻辑上合理、业务上错误的结论。

    Genie 与 Microsoft 365 Copilot 各自负责什么

    Microsoft 365 Copilot 和 Databricks Genie 并不是同一种产品。前者理解邮件、会议、文档和组织协作上下文,后者理解企业数据平台中的表、指标和业务语义,两者组合后才可能完成从“发生了什么”到“为什么发生”的跨系统分析。

    | 产品 | 核心定位 | 主要数据范围 | 典型入口 | 治理基础 | 独立新增价格 | |—|—|—|—|—|—| | Databricks Genie | 自然语言企业数据分析 | Lakehouse 中的表、指标及语义信息 | Databricks、Teams、Microsoft 365 Copilot、Copilot Studio | Unity Catalog、企业 OAuth | 本次合作未公布独立售价 | | Microsoft 365 Copilot | 办公内容理解与任务协作 | 邮件、会议、文档及 Microsoft Graph 上下文 | Teams、Word、Excel、Outlook 等 | Microsoft 365 租户权限与合规体系 | 取决于微软现有许可方案 | | Power BI Copilot | 面向报表和语义模型的辅助分析 | Power BI/Fabric 语义模型与报表 | Power BI、Microsoft Fabric | Fabric 与 Power BI 权限体系 | 取决于容量和许可配置 | | Snowflake Cortex Analyst | Snowflake 数据的自然语言查询 | Snowflake 中的数据与语义模型 | Snowflake 及企业自建应用 | Snowflake 角色与数据治理 | 取决于 Snowflake 用量与产品配置 |

    Databricks Genie 相比 Power BI Copilot 的优势在于,它更靠近 Lakehouse 中的原始数据、工程管道和统一治理层。对于数据已经集中在 Databricks、但消费入口分散在 Teams、门户和内部应用中的企业,Genie 可以减少为每个入口重复建设问答逻辑的工作。

    Power BI Copilot 的优势则是成熟的报表消费环境和微软 BI 用户基础。企业如果已经围绕 Power BI 语义模型完成指标治理,并不一定需要为了自然语言问答再引入 Genie;反过来,如果大量分析发生在 Databricks SQL、数据科学工作流和 Lakehouse 表上,Genie 与数据资产的距离更近。

    Snowflake Cortex Analyst 与 Genie 的竞争逻辑类似,双方都试图把自然语言问题映射到可信的企业指标和查询。它们之间的差别最终不只取决于模型效果,而取决于企业的数据放在哪里、权限体系由谁管理,以及语义层是否已经建设完成。

    办公入口会扩大数据分析的用户规模

    Genie 进入 Microsoft 365 后,最直接的受益者不是数据工程师,而是没有 SQL 能力的业务负责人。数据团队过去需要处理大量重复问题,例如按地区拆分销售额、解释某周转化率变化、查询库存覆盖天数,这些任务技术难度不高,却不断占用分析资源。

    销售场景可以体现这种变化。区域负责人可以在 Teams 讨论业绩时直接询问 Genie:本月目标完成率低于 80% 的客户经理有哪些,并继续追问这些人员的商机数量、平均成交周期和重点流失客户,而不必在会议后再提交取数需求。

    供应链场景更适合连续追问。运营人员可以先找出未来两周可能缺货的产品,再按供应商、仓库和预计收入影响拆分,最后让工作流把高风险项目发送给对应负责人;Genie 提供数据解释,Copilot Studio 负责后续通知和流程动作。

    财务场景则会更谨慎。预算执行、成本拆分和现金流数据通常涉及行列级权限、敏感字段和严格口径,企业需要先定义“收入”“毛利”“活跃客户”等指标,再允许 Genie 面向更大范围员工开放。

    真正的生产力提升不会来自少点两次鼠标,而会来自分析等待时间的缩短。过去一个跨部门数据问题可能要经历提需求、确认口径、排期、写 SQL 和制作报表;进入办公流后,简单问题可以在对话中完成,分析师则集中处理因果判断、实验设计和复杂建模。

    语义层质量决定 Genie 是助手还是“数据幻觉机”

    自然语言分析的准确率上限由企业的数据语义质量决定。模型可以理解“找出高价值客户”,但数据库里可能同时存在按收入、利润、生命周期价值和续费概率定义的四种高价值客户,缺少明确口径时,再强的模型也只能猜。

    企业部署 Genie 前至少需要补齐三类信息:

    • **业务术语定义:**明确收入、订单、客户、流失等核心概念的计算规则;
    • **数据关系说明:**标记表之间的连接方式、时间字段和主键,避免重复计算;
    • **可信查询示例:**提供经过验证的问题和查询逻辑,让 Genie 学会组织内部的表达方式。

    Genie 的价值因此与数据团队前期投入成正比。指标体系清晰、Unity Catalog 权限完整、表描述充分的企业,上线后更容易获得稳定回答;数据表命名混乱、同一指标存在多个版本的企业,只会把原有数据债务包装成更自然的语言。

    回答可验证性同样重要。企业数据助手不能只输出一段看似专业的结论,还应让用户确认所用数据范围、时间窗口、筛选条件和指标定义;涉及经营决策时,用户还需要能够追溯到对应的数据资产或查询过程。

    安全边界不应只停留在“有权限”

    企业 OAuth 和 Unity Catalog 解决的是访问控制,但不能覆盖智能体系统的全部风险。Genie 进入办公流后,用户发起查询的频率和范围都会扩大,数据泄露、提示注入、错误汇总和敏感信息被复制到聊天记录中的风险也会随之上升。

    企业管理员需要额外关注以下问题:

    1. **聊天结果保存在哪里。**查询结果可能进入 Teams 会话、Copilot 历史记录或企业日志,其保留周期不能只看 Databricks 一侧。
    2. **敏感字段能否被汇总推断。**用户即使不能读取单条薪酬记录,也可能通过小样本分组反推出个人信息。
    3. **Agent 能否调用后续动作。**当 Genie 与工作流连接后,错误回答可能触发通知、工单甚至审批,风险高于单纯聊天。
    4. **成本能否被控制。**自然语言的连续追问可能产生多轮模型推理和数据查询,企业需要设置资源、并发和查询预算。
    5. **回答是否有审计证据。**关键经营结论应保留身份、数据版本、查询条件和时间戳,避免无法复盘。

    Databricks 官方文档也单独提示了 Teams 应用的限制项,这说明当前集成仍需要按具体租户、区域和功能可用性进行验证。企业不应把演示中的顺畅对话直接等同于可全员上线的生产能力。

    微软拿入口,Databricks拿数据层

    这次合作延长至 2030 年代,说明双方瞄准的不是一个插件,而是企业 AI 基础设施的长期绑定。Databricks 表示将加大对 Azure 的投入,并扩大使用 Azure Databricks 来运行自身核心业务运营和分析,这相当于它也在用自家与微软联合提供的云上产品验证规模化能力。

    微软的收益是让 Microsoft 365 Copilot 获得更深的企业数据访问能力。办公助手如果只能总结邮件和会议,很容易停留在内容整理层;接入 Genie 这类数据 Agent 后,它才有机会回答经营问题,并把分析结果带入会议、协作和自动化流程。

    Databricks 的收益是获得 Microsoft 365 的分发入口。企业数据平台通常由工程师和分析师使用,而 Teams 和 Microsoft 365 面向的是全体知识工作者;Genie 一旦进入这些入口,潜在用户规模会从数据团队扩展到销售、财务、运营和管理层。

    双方还计划增加对 Microsoft Azure Cobalt 的使用。**Azure Cobalt 是微软自研的 Arm 架构云端处理器系列。**Databricks 此次只表示会通过增加使用 Cobalt 提升性能和效率,尚未披露具体实例规格、迁移比例、成本降幅或查询性能数据,因此现阶段更适合把它理解为基础设施合作信号,而不是可以量化的产品性能升级。

    这次更新有用,但不会自动消灭 BI

    Genie 接入 Microsoft 365 是一个实用方向,因为企业员工更愿意在熟悉的办公入口提问,而不是学习另一个分析产品。不过,它替代的首先是临时取数、简单拆分和重复问答,而不是经过审计的财务报表、固定经营看板或复杂的数据科学工作。

    传统 BI 仍然适合持续监控和统一展示。管理者每天需要查看的核心指标,不应该每次都通过自然语言重新生成;自然语言助手更适合处理看板之外的追问,例如某个指标为什么变化、哪些客户贡献了差异、是否存在异常分组。

    Genie 的竞争力最终取决于三个指标:回答是否可信、权限是否完整、从提问到结果是否足够快。Databricks 与微软目前没有公布此次集成的独立价格、端到端延迟、查询准确率或企业部署规模,因此暂时无法用统一跑分判断它对 Power BI Copilot、Snowflake Cortex Analyst 等产品的领先幅度。

    可以确定的是,企业数据助手正在从独立聊天页面转向办公软件中的基础能力。模型本身会逐渐商品化,真正形成壁垒的将是身份链路、语义层、数据治理和工作流分发,而这恰好是微软与 Databricks 各自最擅长的部分。

    参考来源

    按指定的可访问域名范围,以下权威来源未附站外超链接,仅保留来源名称与内容说明。

    • **Databricks 与微软扩大合作公告:**说明双方将战略合作延长至 2030 年代,并推进 Genie、Microsoft 365、Azure Databricks 与 Azure Cobalt 的整合。
    • **Databricks Genie on Microsoft 365 Copilot 官方文档:**说明 Teams 应用和 Power Platform/Copilot Studio 两种部署路径,以及在 Microsoft 365 Copilot 中选择 Genie 的方式。
    • **Microsoft Learn:Databricks Genie on Microsoft 365 Copilot:**说明 Azure Databricks 与 Microsoft 365 Copilot 的连接、安装和使用流程。
    • **Databricks 官方博客《Use Genie Everywhere with Enterprise OAuth》:**说明企业 OAuth、Teams、Copilot Studio、SDK 与自定义应用中的身份和权限治理方式。
    • **36氪 7 月 23 日快讯:**转述 Databricks 与微软延长战略合作及扩大 Azure 投入的最新消息。
  • GPT-5.5看得见,却不会动

    GPT-5.5看得见,却不会动

    ActiveVision 最新测试显示,GPT-5.5 得分仅为 10.6%,远低于人类的 96.1%。模型能识图、写代码,却仍难以在变化环境中持续观察并主动操作。

    GPT-5.5 在主动视觉测试中只拿到 10.6%

    GPT-5.5 在新基准 ActiveVision 上只解决了 10.6% 的测试项目,并在 17 项任务中的 11 项得分为零。同期参与评测的 Claude Fable 5 得分更低,仅为 3.5%;三名人类参与者的平均成绩则达到 96.1%。

    这组结果来自本周公开的预印本论文,论文编号为 arXiv:2607.16165。研究者使用了 GPT-5.5 对外开放的最高推理强度档位,但它与人类之间依然相差 85.5 个百分点;按得分比例计算,人类成绩约为 GPT-5.5 的 9.1 倍。

    ActiveVision 成绩对比柱状图,GPT-5.5 为 10.6%、Claude Fable 5 为 3.5%、人类为 96.1%

    ActiveVision 是一套测试模型能否通过反复观察、判断和操作完成视觉任务的基准,而不是让模型对一张静态图片做一次性描述。它包含 17 项任务,分属 3 个类别,设计目标是迫使模型持续获取新的视觉信息,而不能只靠第一眼生成答案。

    | 参与者或模型 | ActiveVision 得分 | 零分任务 | 与人类差距 | |—|—:|—:|—:| | GPT-5.5(最高公开推理强度) | 10.6% | 11/17 | 85.5 个百分点 | | Claude Fable 5 | 3.5% | 论文摘要未单列 | 92.6 个百分点 | | 人类参与者(3 人平均) | 96.1% | 未披露 | — |

    GPT-5.5 虽然比 Claude Fable 5 高出 7.1 个百分点,得分约为后者的 3 倍,但这并不意味着它已经接近可用。10.6% 在真实产品里意味着绝大多数操作链都会中途失败,而 11 项任务直接归零,则说明模型面对的不是偶发识别错误,而是一整类能力缺失。

    ActiveVision 测的不是“看图答题”

    主动视觉是智能体根据当前观察主动选择下一步动作,并利用动作带来的新画面继续推理的能力。它与传统视觉问答最大的区别在于,输入不是固定的:模型点击、移动、缩放或改变视角之后,环境会发生变化,模型必须重新确认状态。

    传统多模态评测更像把一张卷子拍下来交给模型,而 ActiveVision 更像让模型坐到电脑前亲自完成任务。前者只需要把图像压缩成一次性的语义表示,后者则要求模型循环执行“观察—形成假设—采取动作—检查结果—修正计划”。

    这个差别看起来只是多了几轮交互,实际却把错误来源成倍放大。一条包含 10 个步骤的操作链,即使模型每一步成功率都有 90%,整条链全部正确的概率也只有约 34.9%;如果单步可靠性降至 80%,最终成功率会跌到约 10.7%,恰好接近 GPT-5.5 此次的整体成绩。

    ActiveVision 因此暴露的是系统级可靠性,而不只是单张图片的识别准确率。模型可能第一步看对了按钮,第二步却没有确认点击是否生效;也可能正确识别局部元素,却忘记当前任务进行到了哪里;还可能在操作失败后继续沿用旧状态推理,最终让整条行动链偏离目标。

    同一个 GPT-5.5,静态视觉能拿 76.12%

    GPT-5.5 的低分不能简单归结为视觉编码器太弱,因为它在静态视觉测试中的表现并不差。Roboflow 公布的第三方 Vision Evals 显示,GPT-5.5 综合准确率为 76.12%,在 63 个参评模型中排名第四。

    | 测试项目 | GPT-5.5 成绩 | 主要考察能力 | |—|—:|—| | Roboflow Vision Evals 综合成绩 | 76.12% | 静态图像理解与视觉问答 | | 文档理解 | 88.9% | OCR、版面结构和文字关系 | | 缺陷检测 | 86.7% | 发现图像中的异常区域 | | 对象理解 | 85.7% | 识别物体及其语义属性 | | 精确计数 | 30.0% | 对重复目标进行准确计数 | | ActiveVision | 10.6% | 反复观察、操作与状态更新 |

    这两组成绩并不矛盾,反而清楚展示了前沿模型能力的“锯齿状边界”。GPT-5.5 可以读懂复杂文档、判断物体属性,也能在缺陷检测任务中取得 86.7%,但一旦视觉信息需要随着动作持续更新,它的能力就从 70%—80% 档位跌到 10.6%。

    第三方分析认为,GPT-5.5 采用了基于 32×32 patch 的视觉编码方式,这有利于处理高分辨率文档、图表和结构化布局。Patch 可以理解为模型观察图片时使用的小方格:图片先被切成网格,再转换为视觉 token 进入模型。它能帮助模型“读懂画面”,却不会自动赋予模型稳定的行动闭环。

    精确计数只有 30% 也是同一种问题的较轻版本。模型可以知道画面里有很多相似物体,却容易重复计算、遗漏目标或失去空间对应关系;在主动操作里,这种空间追踪误差还会与历史状态、动作反馈和任务目标叠加,最终形成连续失败。

    会写代码,也没有补上视觉闭环

    ActiveVision 最值得关注的发现不是前沿模型又输掉了一次新跑分,而是模型无法靠自己写代码修补能力缺口。论文专门观察了模型能否生成辅助程序来完成任务,但代码能力没有顺利转化为主动视觉能力。

    这对 GPT-5.5 尤其刺眼,因为编码和智能体执行正是它这一代的主打方向。公开数据中,GPT-5.5 在 Terminal-Bench 2.0 上达到 82.7%,比 GPT-5.4 提高 7.6 个百分点;BrowseComp 成绩为 84.4%,提高 1.7 个百分点。GPT-5.5 Pro 在 BrowseComp 上还可以达到 90.1%。

    | 基准 | GPT-5.5 成绩 | 任务性质 | 能否直接代表主动视觉 | |—|—:|—|—| | Terminal-Bench 2.0 | 82.7% | 终端环境中的编码与执行 | 不能 | | BrowseComp | 84.4% | 浏览、检索与信息整合 | 不能 | | GPT-5.5 Pro BrowseComp | 90.1% | 更高强度的浏览推理 | 不能 | | ActiveVision | 10.6% | 视觉反馈驱动的连续操作 | 可以直接衡量 |

    代码不能救场的原因并不神秘:程序可以放大、裁切、标记和比较图像,却不能替模型决定什么时候应该重新观察,也不能保证模型正确理解程序输出。只要模型对环境状态的表征已经错了,它就可能写出逻辑正确但输入错误的工具,然后更自信地沿着错误路径前进。

    主动视觉真正缺少的是“感知策略”,而不是另一个图像处理函数。一个可靠智能体需要知道当前证据是否充分、某次点击有没有成功、界面是否发生了预期变化,以及什么时候应该放弃原计划重新定位目标。这些判断无法靠一次代码生成完成。

    高推理强度为什么仍然不够

    增加推理 token 主要改善的是模型在已有信息上的搜索深度,却无法保证它主动获得了正确的新信息。模型如果从第一帧就误认目标位置,后续再长的思维链也可能只是在错误地图上做更复杂的规划。

    视觉行动任务至少同时依赖四层能力:

    1. 视觉定位能力:准确找到目标元素,而不只是说出画面中“存在一个按钮”。
    2. 状态记忆能力:记住已经执行的动作、当前进度与环境变化。
    3. 反馈校验能力:每次操作后确认结果,而不是默认动作已经成功。
    4. 恢复规划能力:发现界面不符合预期时回退、重试或更换策略。

    任何一层出现短板,都会让高推理强度失去意义。当前模型常见的工作方式是先根据首帧形成一个完整计划,再连续执行多个动作;人类则更倾向于每做一步就扫一眼界面,用低成本反馈修正下一步。后者看起来没有长篇推理,实际却拥有更密集的闭环校验。

    人类 96.1% 的成绩说明这些任务并非依靠冷门知识或超人视觉才能完成。尽管只有 3 名人类参与者,样本规模不足以代表完整人群分布,但接近满分的平均结果仍足以表明:ActiveVision 的主要难点来自模型架构和交互策略,而不是任务本身含糊不清。

    10.6% 对视觉智能体意味着什么

    ActiveVision 的结果直接给“截图驱动型智能体”泼了一盆冷水。只要产品需要模型根据连续截图控制桌面软件、网页、工业界面或远程设备,静态视觉问答跑分就不能作为可靠性的替代指标。

    浏览器智能体可能因为 DOM 和无障碍树而显得比纯视觉智能体成熟。结构化页面会直接告诉模型某个元素是按钮、输入框还是链接,相当于给它一份机器可读的地图;ActiveVision 这类任务则更接近只给截图,让模型自己完成定位和状态跟踪,难度自然更高。

    机器人场景面临的风险还会进一步放大。网页点错按钮通常可以撤销,但机械臂抓错位置、移动设备误判障碍物或工业系统重复执行指令,都可能产生物理成本。10.6% 的成功率意味着这类模型目前更适合作为建议者和异常提示器,而不是脱离监督的最终执行者。

    现阶段更现实的产品路线是限制动作空间,并给视觉模型加上外部校验。开发者可以让模型每次只选择少量预定义动作,要求关键操作前后保存截图,对高风险步骤使用传统视觉算法或规则系统复核,并在状态变化不明确时强制停止,而不是让模型凭自然语言计划一路执行到底。

    GPT-5.5 仍然强,但强得并不均匀

    GPT-5.5 不是一款视觉能力差的模型,而是一款在视觉语义理解和视觉行动之间存在巨大断层的模型。它在文档、对象和缺陷理解上表现靠前,在终端编码与网页研究中也有领先成绩,但这些能力尚未组合成稳定的主动操作系统。

    这种断层也解释了为什么演示视频常常比真实部署更惊艳。演示可以挑选成功路径、固定窗口尺寸并避免意外弹窗,生产环境却会出现加载延迟、遮挡、动画、焦点丢失和状态不同步;模型只要漏掉一次反馈,后续步骤就可能全部失效。

    价格同样会放大这一问题。GPT-5.5 的公开价格为每百万输入 token 5 美元、每百万输出 token 30 美元,上下文窗口为 100 万 token;GPT-5.5 Pro 则分别达到 30 美元和 180 美元。主动视觉需要重复上传画面并进行多轮推理,如果成功率仍只有 10.6%,更高推理预算很容易变成昂贵的重复试错。

    | 模型 | 输入价格 | 输出价格 | 上下文窗口 | ActiveVision 已披露成绩 | |—|—:|—:|—:|—:| | GPT-5.5 | 5 美元/百万 token | 30 美元/百万 token | 100 万 token | 10.6% | | GPT-5.5 Pro | 30 美元/百万 token | 180 美元/百万 token | 公开信息未在论文摘要中对应说明 | 未单列 |

    ActiveVision 的价值正在于把“会看”和“会做”拆开评估。模型读懂一张截图,并不等于它能在十张连续截图中保持同一目标;模型会生成自动化脚本,也不等于它能判断脚本何时失效。对开发者而言,这比又一个综合多模态分数更接近真实产品问题。

    真正的突破要看闭环成功率

    下一代视觉智能体的关键指标不应只是单帧准确率,而应包括长链任务成功率、动作后复核率、错误恢复率和平均无故障步数。只有这些指标同步提高,模型才可能从“能解释界面”走向“能可靠操作界面”。

    GPT-5.5 的 10.6% 也不意味着主动视觉没有进展空间。模型厂商可以引入更细粒度的视觉记忆、显式状态表示、动作前后差分检测,以及针对失败恢复的强化学习;基准设计者则需要继续区分识别错误、动作错误、记忆错误和恢复失败,避免把所有问题压成一个总分。

    目前最稳妥的结论是:GPT-5.5 已经是强大的静态视觉理解模型和编码模型,但还不是可靠的视觉操作模型。它看得懂很多东西,也能写出复杂程序;真正困难的是让它在每一次动作之后重新看清现实,并承认现实可能没有按计划发展。

  • Comfyui从O到1环境配置指南(全教程)

    01.重要:升级最新显卡驱动,打开虚拟内存,重启电脑:
    显卡驱动入口:https://www.nvidia.cn/drivers/lookup/

    虚拟内存设置:

    电脑桌面->“此电脑”右键属性-高级系统设置-设置(高级)

    02、安装git,网盘下载的,默认安装,不要管弹什么,一直下一步,不要自定义路径

    03、安装python,默认安装路径,注意勾选添加变量(之前如果装过python跳过这一步就可以,之前装的什么版本都无所谓,跟整合包不冲突)

    04、安装VisualStudio,这里要注意,有勾选项目要求,一样的,默认路径不要改

    5.安装cuda12.8,注意,建议装12.8,因为整合包内置的就是最高版,20-50系全系是支持12.8的,类似于A100之类的显卡,不支持~

    06、安装cudnn,默认安装

    07、解压ffmpeg6.0到指定路径,注意,一定不能套目录!!!好好检查

    08、电脑右键,属性,高级系统设置,设置环境变量

    逐条检查以上变量,确认路径存在,重启电脑(可手动复制我下面的,前提是你确实是默认路径安装)

    这里不要过于死板,因为有时候你安装版本跟我不同,比如第一条路径是14.43.34808,可能你装的时候数宁变成新版了,所以要自己举一反三,对照找到自己安装的版本

    C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.43.34808\bin\Hostx64\x64
    C:\Program Files\Microsoft Visual Studio\2022\Community\Common7\IDE\CommonExtensions\Microsoft\CMake\CMake\bin
    C:\Program Files\Git\cmd
    C:\Program Files\NVIDIA\CUDNN\v9.8\bin
    C:\Program Files\NVIDIA\CUDNN\v9.8\include
    C:\Program Files\NVIDIA\CUDNN\v9.8\lib\x64
    C:\ffmpeg6.0\bin

    10、完美启动!

  • AgnesCode 下载

    AgnesCode 下载

    Agnes AI 推出的桌面端 AI 编程工作台

    AgnesCode 是什么

    AgnesCode 是 Agnes AI(Sapiens AI)推出的桌面端 AI 全场景工作台,支持 macOS 与 Windows 独立运行,不是 IDE 插件也不是 VS Code 分叉。AgnesCode 通过单一自然语言输入框串联本地项目空间、智能/专家双模式、Skills 能力包与 App Connect / MCP 外部工具,默认搭载不限期免费的 Agnes-2.5-Flash​ 编程特化模型,并支持路由至 Agnes-2.5-Pro 及 GPT-5.5、Claude、Gemini、DeepSeek 等外部模型,覆盖从需求描述、跨文件编码、Bug 修复到网页/图片/视频产物交付的完整链路,让 AI 从”聊天窗”变成直接嵌入本地工作流的协作者。


    AgnesCode 的主要功能

    单一输入框调度:在桌面端输入框用自然语言描述目标(如”给订单模块加 JWT 鉴权并补单测”),AgnesCode 自动理解项目上下文、拆解步骤、调用工具链与 Skills 执行,并在项目空间内回写产物。

    智能 / 专家双模式

    • 智能模式:自动选模型、选 Skill、选工具路径,适合日常写码、修 Bug、出原型。
    • 专家模式:手动指定模型(Flash / Pro / 外部 API)、上下文范围、工具白名单、输出格式与预算上限,适合架构评审、金丝雀重构、团队 SOP 执行。

    本地项目空间:按项目独立归档文件夹、业务上下文、对话记忆与交付物(代码 / 文档 / 图片 / 视频),避免结果淹没在聊天记录里;授权目录后直接读依赖树,支持跨十几个文件协调修改接口与调用逻辑。

    多模型与自动路由:内置 Agnes-2.5-Flash(不限期免费)、Agnes-2.5-Pro(旗舰,对标 Claude Opus 4.8 / GLM-5.2),同时可填 API Key 接入 GPT-5.5、Claude Fable 5、Gemini 3.5、DeepSeek V4、GLM 5.2 等;Auto 路由按任务类型平衡质量、速度与成本。

    Skills 能力封装:把团队 SOP、代码规范、行业知识、常用脚本封装成可复用技能包,专家模式下可指定调用,智能模式下由 Agent 自动识别调度。

    App Connect / MCP:通过 MCP 标准协议与浏览器、Figma、飞书文档、Excel、内部 API 打通,桌面端成为统一操作入口,支持 AI 直接读页面、截图表单、回写表格。

    产物集中管理:代码 diff、生成的网页原型、PPT、海报、短视频统一落在项目空间,支持继续编辑、本地预览、导出与分享链接。

    权限与安全:敏感操作(删文件、跑 shell、发 HTTP)前置确认;本地项目访问范围按工作区隔离;关键变更留审计记录;代码默认不上云训练。

    账号与积分一体化:桌面端用 Agnes Web 账号登录,订阅、Token Plan 积分、团队权限与网页/App 端实时同步;每日登录送基础积分,Flash 模型不扣费。


    如何使用 AgnesCode

    下载安装:访问 https://agnes-ai.com/agnescode ,按系统自动推荐 macOS(Apple Chip / Intel)或 Windows 10+ x64 的 .dmg / .exe 安装包。

    登录与授权:用 Agnes 账号登录(与 Web 端同体系);首次启动选择本地工作区文件夹并授权读取,AgnesCode 会建立项目级上下文索引。

    选模式发起任务

    • 智能模式:输入框写”修复登录页重定向循环,并补回归测试”→ 自动拆步执行 → 展示 diff → 本地验证。
    • 专家模式:切到专家面板,指定 agnes-2.5-pro + 仅允许 @src/auth/* 上下文 + 调用 /unittest Skill + 禁止 shell,再发任务。

    接外部模型:设置里填 OpenAI 兼容端点(Agnes API 本身兼容 sk- 格式 OpenAI SDK),模型名填 agnes-2.5-flash 或外部模型名即可热切换。

    审产物:代码变更在项目空间 Diff 视图审阅;网页原型双击本地预览;图片/视频进资源区继续用 Agnes-Image / Agnes-Video 迭代。

    定时任务(Loop 类):在设置中配置”每日 9 点跑 CI 失败归因””周五整理 PR 评审意见”,桌面端保活期间无人值守执行。


    关键信息与使用要求

    • 系统要求:macOS 12+ / Windows 10+ x64,桌面端独立进程,不强制依赖 VS Code。
    • 默认模型:Agnes-2.5-Flash 不限期免费;Agnes-2.5-Pro 为付费旗舰(近期上线);外部模型按各厂商计费。
    • 上下文管理:项目空间级隔离,不跨项目携带;支持手动 @文件 精准引用。
    • MCP 安全:App Connect 权限逐应用授权,敏感系统(内部 API、写数据库)需专家模式显式开启。
    • 积分体系:智能模式走 Flash 不耗积分;切 Pro 或外部高价模型走 Token Plan(Starter / Plus / Pro 档位)。

    核心优势

    • 全场景而非纯 IDE:同个输入框写完代码,顺手出 PPT、生成产品图、剪演示视频,交付物全部归档在项目空间。
    • 免费主力模型能打:Agnes-2.5-Flash 在代码理解、跨文件重构、Bug 定位上进入第一梯队,且不封号、不绑卡、不限期免费,规避 Codex/Claude Code 的区域与 KYC 风险。
    • 双模式兼顾小白与架构师:智能模式零配置上手,专家模式把模型/上下文/工具/预算全交出。
    • Skills 让团队规范可复用:把”我们怎么写 Go 错误处理”封成包,新人用智能模式也能产出合规代码。
    • 桌面原生 + 本地优先:读本地仓库、拦敏感 shell、留审计,比纯云端 Coding 工具更适合企业内网项目。

    同类竞品对比

    维度AgnesCodeOpenAI CodexClaude CodeCursor
    产品形态独立桌面工作台(Mac/Win)桌面+CLI+IDE 插件终端 TUIAI 原生 IDE
    默认模型Agnes-2.5-Flash(免费)GPT-5.3-codexClaude Opus/Sonnet多模型
    外部模型✅ 75+ 可路由❌ 限 OpenAI❌ 限 Anthropic✅ 但偏 OpenAI/Claude
    非代码产物✅ 图/视频/PPT/文档有限
    项目空间✅ 按项目归档产物Thread 级会话级工作区级
    Skills/MCP✅ 双支持Skills 部分工具调用强规则弱
    免费门槛Flash 不限期免费免费版基础需订阅需订阅
    适用人群开发+产品+设计多角色工程团队后端 CLI 党全栈 IDE 党

    应用场景

    • 日常编码与单测:描述函数意图 → 生成实现 + 单测 + Mock,本地跑通后 diff 合入。
    • 跨文件重构:在 15 个相互 import 的文件里统一改鉴权中间件,保持调用链不断。
    • Bug 根因定位:贴堆栈和复现步骤,Agent 读仓库定位到隐藏的类型窄化错误并给补丁。
    • 从零出可运行原型:一句话”玻璃水面+星光粒子的落地页”,直接出 HTML/JS 原型并本地预览。
    • 开发+物料一条龙:同一个项目空间里,代码提交后顺手让 Agnes-Image 出运营图、Agnes-Video 出 15 秒演示片。
    • 团队 SOP 固化:把”发版前必跑的 5 个检查”封成 Skill,专家模式定时跑。
  • OpenCode

    OpenCode

    开源 AI 编程工具 , Claude Code 最佳平替

    OpenCode 是什么

    OpenCode 是一款开源的 AI 编程智能体(Coding Agent),被称为 Claude Code 的最佳平替。OpenCode 采用客户端/服务器架构,支持终端 TUI、桌面应用(macOS / Windows / Linux)及 VS Code / Cursor 等 IDE 插件多端统一,内置 LSP 语言服务器协议与 MCP 工具调用,让开发者在本地隔离环境中高效编写、审查和重构代码。OpenCode 支持接入 75+ LLM 提供商——包括 Claude、GPT、Gemini、DeepSeek 及本地 Ollama 模型,默认不存储任何代码或上下文数据,适合隐私敏感场景与企业合规需求。


    OpenCode 的主要功能

    多端统一访问:提供原生终端 TUI(响应式主题可定制)、Electron 重构的桌面应用(支持多 Tab 并行会话),以及 VS Code / Cursor IDE 扩展,同一 OpenCode 服务驱动所有入口。

    75+ 模型提供商接入:通过 Models.dev 注册表接入 Anthropic、OpenAI、Google Gemini、Moonshot、DeepSeek、Z.ai 等,支持 OpenAI 兼容端点及本地 Ollama 模型;也可用 GitHub Copilot 或 ChatGPT Plus/Pro 账号登录直连。

    Plan / Build 双模式:Plan 模式以只读方式分析代码库并输出执行方案,不修改文件;Build 模式允许 Agent 执行文件编辑、Shell 命令与 Git 操作,配合 /undo 快照回滚保障安全。

    LSP + MCP 深度集成:自动拉起项目对应语言的 LSP 服务器,将类型错误、语法诊断实时反馈给模型实现自修正;支持 Model Context Protocol 接入外部工具与数据源。

    多会话并行 & 标签页:同项目可同时开启多个独立 Agent 会话(各会话上下文隔离),桌面端 v2 支持 Tab 页管理,不同会话可分配不同模型并行执行任务。

    上下文压缩(Auto Compact):对话接近模型上下文上限时自动摘要历史,保留关键信息丢弃冗余,降低长任务 token 消耗与响应延迟。

    Git 集成与会话分享:内置 Git 操作,TUI/桌面端可直接审阅文件变更差异(Diff);支持生成会话分享链接,方便团队调试与协作。

    隐私优先 & 本地化:默认不上传、不存储用户代码与对话上下文;支持纯本地模型运行,满足金融、医疗等受监管行业的合规要求。


    如何使用 OpenCode

    安装 OpenCode:终端执行 curl -fsSL https://opencode.ai/install | bash,或通过 npm(npm i -g opencode)、Homebrew(brew install opencode)安装;桌面版从官网下载安装包。

    启动与连接模型:终端输入 opencode 启动 TUI,首次可通过 /connect 配置 API Key 或登录 Claude/ChatGPT/GitHub 账号;桌面端在设置面板选择内置免费模型或添加外部提供商。

    初始化项目:进入项目目录执行 opencode init 生成配置文件(AGENTS.md / opencode.json),定义项目规范与 Agent 行为。

    发起任务:在输入框用自然语言描述需求,如”为用户模块添加 JWT 鉴权”,按 Tab 切换 Plan/Build 模式。Plan 模式先输出方案供确认,再切入 Build 模式执行修改。

    审查与回滚:任务完成后通过内置 Diff 视图逐条审阅变更,确认无误后可提交;若改动不符合预期,输入 /undo 一键回滚至上个 Git 快照。

    桌面端高级操作:利用多 Tab 同时开启”写接口”和”修 Bug”两个并行会话;通过 @文件名 引用上下文,使用 /review 触发代码评审,/compact 手动触发上下文压缩。


    OpenCode 的关键信息和使用要求

    • 运行环境:Core 服务端支持 Node.js(v2 已弃用 Bun),桌面端基于 Electron,TUI 基于自研 OpenTUI 框架。
    • 配置文件:项目级 AGENTS.md 定义编码规范与指令,opencode.json 管理模型、权限与 MCP 服务器;支持目录级级联加载。
    • 权限控制:可配置 Shell 命令、文件读写、MCP 工具调用的允许/拒绝列表,细粒度管控 Agent 操作范围。
    • 网络与远程:支持 opencode serve 启动后台服务,通过 Tailscale 等组网实现跨设备远程会话同步与状态恢复。
    • 上下文管理:单会话独立上下文,Auto Compact 自动压缩,MCP 服务器建议按需启用以避免Token浪费。

    OpenCode 的核心优势

    • 模型无关零锁定:不绑定任何厂商模型,随时切换 Claude / GPT / Gemini / 本地模型,规避 API 停服与涨价风险。
    • 开源可审计:MIT 许可证,代码完全开放,企业可自托管、二次开发与合规审计。
    • 低 Token 开销:精简的 Agent Harness(约 7k token 基线 vs Claude Code ~33k),相同模型下上下文利用率更高、缓存命中率更好。
    • 多端并行工作流:桌面 v2 多 Tab + 多会话并行,不同 Agent 可分配不同模型协作完成任务。
    • 隐私合规友好:零数据存储承诺 + 本地模型支持,满足严格的数据不出境/不出域要求。
    • LSP 驱动自修正:编辑后即时拉取 LSP 诊断回传模型,减少低级语法与类型错误。

    OpenCode 的同类竞品对比

    对比维度OpenCodeClaude Code (Anthropic)Cursor (Anysphere)OpenAI Codex CLI
    产品定位开源模型无关 AI Coding AgentAnthropic 官方终端 AgentAI 原生 IDEOpenAI 官方终端 Agent
    交互界面TUI + 桌面应用 + IDE 插件纯终端 TUI完整图形化 IDE终端 CLI + 云端
    核心模型75+ 提供商 / 本地模型Claude Opus / Sonnet 系列GPT / Claude / 自研GPT-5.x-codex
    执行模式Plan/Build 双模式 + 多会话并行单会话逐步执行 + 嵌套子 AgentTab 补全 + Agent 模式多 Agent 并行 + 定时任务
    项目管理会话级隔离 + 可选工作区基于目录的会话基于工作区文件树文件夹工作区 + Thread
    开源协议MIT 完全开源闭源专有闭源专有Apache-2.0(CLI 部分)
    模型锁定无锁定,随意切换仅 Anthropic 模型多模型但需平台订阅优先 OpenAI 模型
    本地/隐私支持本地模型,零数据上报依赖 Anthropic 数据策略依赖平台数据策略可选本地执行
    适用人群重视开源/隐私/多模型切换的开发者Claude 生态深度用户、后端工程师全栈开发者、重度 IDE 用户ChatGPT 订阅用户

    OpenCode 的应用场景

    • 日常功能开发:用自然语言描述需求生成 CRUD、API 接口、单元测试,自动运行测试并修复报错。
    • 遗留代码库分析与重构:Plan 模式先梳理复杂模块依赖与架构问题,输出重构方案后再执行,降低误改风险。
    • 多模型协作的长时任务:规划阶段用强推理模型(Claude Opus / GPT-5),执行阶段切到性价比模型(Sonnet / 本地模型),控制成本。
    • 隐私敏感行业开发:金融、医疗、政务项目使用本地 Ollama 模型跑 Agent,代码不出内网。
    • 教学与结对编程:学生通过会话分享链接向导师展示 AI 辅助解题过程,或团队内部共享 Agent 会话复盘决策路径。
  • OpenClaw下载

    OpenClaw下载

    开源免费的个人 AI 助手

    OpenClaw 是什么

    OpenClaw(龙虾🦞)是开源免费的个人 AI 助手,能在你的 Mac、Windows 或 Linux 电脑上本地运行,通过飞书、钉钉、WhatsApp、Telegram、iMessage 等聊天软件接收指令,直接操作电脑完成任务——整理文件、修复代码、管理邮件、控制智能家居,甚至写脚本自动下单。它不像传统助手那样“你问它答”,而是“你吩咐它动手”,并具备永久记忆能力,能记住你的偏好和上下文,根据你的新指令“自学新技能”,越用越懂你。灵活的插件系统和多智能体协作机制,让它成为提升个人效率与生产力的理想工具。


    OpenClaw 的核心功能

    聊天即操作

    在飞书、Telegram 或 WhatsApp 里发一句“帮我整理桌面上的项目文档并归档到 ~/Work/2026”,OpenClaw 就会自动打开终端、创建目录、移动文件、生成日志,并把结果截图发回给你。支持批量处理、定时执行、跨应用联动。

    多平台 & 多模型支持

    原生支持 macOS 15+、Windows 10 20H2+/11、主流 Linux 发行版;可接入 Anthropic Claude、OpenAI GPT、Google Gemini、本地量化模型(如 Qwen2.5、Llama3.1),由用户自由切换。网关层统一调度,无需手动配置 API。

    持久化记忆与自我进化

    会话历史、文件结构、用户习惯、任务模板全部存本地 SQLite 或向量库,重启后依然记得“上次你把报表放哪了”。你教它一次“如何给客户发跟进邮件”,它就能内化成一个永久技能,下次直接调用。

    系统级操作权限

    拥有与你当前用户同等的系统权限,可调用终端、安装软件、编辑注册表、控制 IoT 设备(如 Hue 灯、智能插座)、操作浏览器(Chrome/Firefox/Safari),甚至通过 SSH 远程管理服务器。

    网关集成与多智能体协作

    通过轻量级网关连接各类聊天平台,实现指令与反馈实时同步。支持克隆多个智能体实例,比如一个专管代码、一个专管日程、一个专管购物,各自独立又协同工作。

    技能扩展市场(ClawHub)

    社区贡献超 1.3 万个技能插件,覆盖网页调研、邮件退订、会议记录、文件分类、代码重构等场景。你也可以自己编写技能,上传到 ClawHub 分享给其他人。

    自动化工作流引擎

    支持设置 cron 式定时任务,如“每天早 9 点汇总未读邮件”、“每周五下午 4 点自动备份项目”、“每月 1 号生成财务简报”,真正做到“设定一次,长期省心”。


    如何使用 OpenClaw

    前置条件

    确保系统已安装 Node.js ≥ 22 和 Git(pnpm 可选,推荐用于源码构建)。

    一键安装(官方推荐)

    • macOS/Linux 终端:curl -fsSL https://openclaw.ai/install.sh | bash
    • Windows PowerShell:iwr -useb https://openclaw.ai/install.ps1 | iex 或 npm 全局安装:npm i -g openclaw,然后运行 openclaw onboard

    引导配置

    执行 openclaw onboard --install-daemon,按向导设置:

    • 选择模型(推荐 OAuth 认证)
    • 配置网关端口(默认 18789)
    • 绑定聊天通道(WhatsApp 扫码 / Telegram 填 token / 飞书配 App ID)
    • 设置配对审批规则(首次 DM 需手动 approve)

    启动服务

    引导完成后,网关会自动后台运行;也可手动启动:

    openclaw gateway --port 18789 --verbose

    验证连接

    新开终端执行:

    openclaw status —— 查看网关状态

    openclaw health —— 检查服务健康度

    moltbot health —— (旧版命令,已废弃,勿用)

    连接第一个聊天平台

    以 WhatsApp 为例:

    openclaw channels login whatsapp → 扫描 QR 码 → 等待配对码 → 执行 openclaw pairing approve whatsapp <code> 批准

    从源码构建(开发者适用)

    git clone https://github.com/openclaw/openclaw.git
    cd openclaw
    corepack enable
    pnpm install
    pnpm run build
    openclaw onboard --install-daemon

    端到端测试

    在新终端发送测试消息:

    openclaw message send --target <phone_number> --message "Hello from OpenClaw"

    确认对方收到回复即成功。

    可选扩展

    • 安装 macOS 菜单栏 App / Windows 托盘 / iOS/Android 伴生节点(支持相机、语音、Canvas)
    • 设置远程访问(SSH 隧道 / Tailscale / Cloudflare Tunnel)
    • 配置自动化工作流(.claw/workflows/ 目录下写 YAML)

    OpenClaw 的核心优势

    安全可控的本地优先架构

    所有数据和处理都在本地完成,不依赖云端服务器,敏感操作可离线执行。管理员可通过 Billing → Set spending limit 设硬上限,防止意外超支。

    真正的“动手型”AI 助手

    不只是聊天问答,而是能真正“动手改文件、跑脚本、装软件、控设备”。适合需要高频自动化操作的个人或小团队。

    持续学习与技能沉淀

    通过 ClawHub 市场和自定义技能,让 AI 从“工具”变成“伙伴”,越用越聪明,越用越贴合你的工作流。

    跨平台无缝体验

    无论你在手机、电脑还是平板,只要登录同一账号,就能继续之前的任务,记忆不断线。

    低成本高自由度

    本体免费(MIT 协议),只有模型 API 调用费和云资源成本(可选托管版 openclawd.ai 收费)。本地部署零运维负担。


    与同类工具对比(简版)

    维度OpenClawClaude CodeCodexCursorKiro
    形态本地 agent + 聊天网关终端 TUI云端沙箱 + 桌面AI-native IDESpec-first IDE
    主模型Claude/GPT/GeminiSonnet 5/Opus 4.8GPT-5.3-CodexComposer 2.5Auto 路由
    独门多聊天平台 + 本地操作长推理贴库无人值守沙箱多端丝滑AWS 审计
    定时cron + Actions/loop + cronAutomationsAutomationsHooks
    强项文件/邮件/智能家居复杂库推理沙箱隔离多端同步规范驱动
    弱项免费配额波动无 GUI本机浅非 AWS 弱

    OpenClaw 的产品定价

    OpenClaw 本体完全免费(MIT 协议),无任何订阅费。真实成本来自两部分:

    1. 模型 API 调用费:按所用模型官方价格计费(Claude/OpenAI/Gemini 等),本地模型零成本。
    2. 云资源成本:如需托管版 openclawd.ai(自动更新、无暴露端口),按托管档收费(约 $34.5/月)。

    💡 提示:学生、教师、开源维护者可申请 Free 档(有限 agent),但非 Pro 全功能免费。


    OpenClaw 的应用场景

    个人效率提升

    通过聊天软件发送指令,管理日程、整理文件、搜索信息、自动回复邮件,解放双手。

    工作自动化

    辅助代码开发、处理邮件、生成项目报告、跑测试、部署 CI/CD,实现全流程自动化。

    家庭自动化

    控制智能家居设备、管理购物清单、自动下单、提醒吃药,让生活更省心。

    学习与研究

    整理学术资料、提供语言学习辅助、生成学习笔记、模拟面试问答,助力高效学习。

    创意与内容创作

    辅助写作、设计排版、视频脚本生成、灵感启发,成为你的创意搭档。


    常见问题

    OpenClaw 是 Anthropic 官方的吗?

    ❌ 不是。名字最早蹭 Claude 梗(Clawdbot),2026 年 1 月因商标争议改名脱离,现与 Anthropic 无隶属关系,但能接 Claude 模型。

    Clawdbot / Moltbot 和 OpenClaw 啥关系?

    ✅ 同一个项目三次改名,代码库一致。旧文档里的 molt.bot 安装脚本、clawdbot 命令均已废弃,现在统一用 openclaw.ai 的脚本和 openclaw 命令。

    安全吗?

    ⚠️ 权限等同于你的用户账号,误配公网暴露网关会有风险。工信部 NVDB 2026 年 2-3 月发过预警,多所高校禁止办公机安装。生产用建议:本机或非公网 VPS、强制 Token 认证、最小权限、不挂敏感凭据。

    支持哪些平台?

    macOS 15+、Windows 10 20H2+/11、Linux;伴生节点覆盖 iOS/Android;可放 Tailscale/SSH 隧道内远程访问。

  • GitHub Copilot下载

    GitHub Copilot下载

    GitHub与OpenAI合作开发的一款革命性的AI编程工具

    GitHub Copilot 是什么

    GitHub Copilot 是 GitHub(微软)推出的 AI 编程平台,最早和 OpenAI 合作起步,2026 年已经从“编辑器里的智能补全插件”演成“嵌入 GitHub 工作流的 AI 运行时”。它不再只猜下一行代码,而是能读整个仓库、在 IDE 里开 Agent 改多文件跑测试、在 GitHub 上把 Issue 自己变成 PR。底层默认走 GPT-5.3-Codex,也可切 Claude Sonnet 5 / Opus 4.8、Gemini 3.5 Flash、Kimi K2.7 等,由 GitHub 在 Azure 上统一调度。

    GitHub Copilot 的主要功能

    实时代码补全与 Next Edit:敲代码时给行内建议、自动跳到下一个该改的位置。所有付费计划里这部分无限量、不扣额度,是最稳的底线能力。

    自然语言转代码:聊天框或 Agent 里用自然语言描述需求,生成片段或整段实现,支持跨文件改动。

    多语言与多编辑器:覆盖 Python、JavaScript、TypeScript、Go、Java、C#、C++、Ruby 等主流语言;接入 VS Code、Visual Studio、JetBrains 全系、Neovim、Xcode、Eclipse、Azure Data Studio。

    上下文注释与解释:为代码补注释、解释某段逻辑、回答“这块为什么这么写”。

    Agent Mode(IDE 内):按 Cmd/Ctrl+I 唤起,自主读库、改文件、跑 shell、跑测试、开浏览器验证前端(Browser Tools 已 GA)。

    云端 Coding Agent:在 GitHub Issue 里 @copilot 派任务,它在临时沙箱里改完直接返 PR,不占用你本机。

    代码审查与 CLI:PR 自动审查留行内评论;终端有 copilot 命令跑后台 agent,可设单次会话额度上限。

    如何使用 GitHub Copilot

    在常用编辑器装扩展:VS Code 装 GitHub Copilot,JetBrains 装 GitHub Copilot 或 AI Assistant 插件,登录 GitHub 账号授权。

    用起来有三种入口:编辑器里行内补全随敲随出;侧边 Chat 问答;Agent Mode 做多文件任务。也可以在终端跑 copilot 命令,或在 GitHub 网页 Issue 里 @copilot 派云端任务。

    写提示时可以直接加注释描述意图,也可以选一段代码问“为什么报错”“怎么重构”。Agent 模式会自己决定改哪些文件,跑完给你看 diff。

    GitHub Copilot 的产品价格

    2026 年 6 月 1 日起,Copilot 从“高级请求次数”切到 GitHub AI Credits(1 credit = 0.01 美元),但基础订阅价没变,变的是 Agent/聊天/审查按 token 扣额度:

    免费档:0 美元,有限聊天与 Agent 额度,补全仍可用。

    Pro:10 美元/月,含 15 美元等值 Credits(1500 粒)。

    Pro+:39 美元/月,含 70 美元等值 Credits(7000 粒)。

    Max:100 美元/月,含 200 美元等值 Credits(20000 粒),给全天候 Agent 用户。

    Business:19 美元/人/月,组织级额度池。

    Enterprise:39 美元/人/月,双倍包含量、SSO/审计/IP 赔偿。

    注意:行内补全和 Next Edit 永远不扣 Credit;Chat、Agent、CLI、PR 审查才扣。超池按所用模型单价续费,管理员可在 Billing 设硬上限。

    常见问题

    GitHub Copilot 免费吗?

    免费档可用,但 Agent 和高级模型有限额;学生、教师、开源维护者走 GitHub Education 或 Free 档,不是过去那种“Pro 全功能免”。

    支持哪些语言?

    Python、JavaScript、TypeScript、Go、Java、C#、C++、C、PHP、Ruby、Scala、Kotlin 等,主流语言都覆盖。

    支持哪些 IDE?

    VS Code、Visual Studio、JetBrains 全家、Neovim、Xcode、Eclipse、Azure Data Studio。

    基于什么模型?

    早期用 OpenAI CodeX(2021–2023),现已退役。2026 年默认 GPT-5.3-Codex(LTS 保到 2027-02),可选 GPT-5.4/5.5、Claude Sonnet 5/Opus 4.8、Gemini 3.5 Flash、Kimi K2.7 等,由 GitHub 统一计量。

  • Cursor全版本下载

    Cursor全版本下载

    Anysphere公司推出的AI代码编辑器,快速进行编程和软件开发

    Cursor 是什么

    Cursor 是 Anysphere(2022 年 MIT 四人组创立)做的 AI-native 编辑器,VS Code fork,但 AI 不是插件而是骨架:Tab 补全、⌘K 行内编辑、Chat、Agent Mode、Cloud Agents、Composer 模型、Agents Window 全部围绕“代码库级上下文”重做。2026-04-02 发布 Cursor 3,界面从“以文件为中心”切到“以 Agent 为中心”,统一侧边栏管本地/云端/手机/Slack 发起的所有 agent,官方称“第三纪元软件工程”。

    当前模型阵(2026-07,可自选或交 Auto 路由)

    • Composer 2.5(2026-05-18):Cursor 自研第三代编码模型,Kimi K2.5 MoE 底座 + 继续预训练 + 文本反馈 RL,SWE-bench Multilingual 79.8%、Terminal-Bench 2.0 69.3%,标准档 $0.50/$2.50 per MTok,Fast 档 $3/$15,Agent 默认走它
    • Claude Sonnet 5 / Opus 4.8 / 4.7 / 4.6(1M 上下文档可用)
    • GPT-5.6 / GPT-5.4 / GPT-5.3-Codex
    • Gemini 3.5 Flash / 3.1 ProGrok Code
    • Auto:按任务在以上之间路由,平衡成本/速度/质量,走独立 usage pool($1.25 in / $6 out / $0.25 cache-read per MTok)

    核心能力(2026 实测栈)

    Agent Mode + Agents Window(Cursor 3 主干)

    • Agent 读库、写计划、跑 shell、跨目录改文件、跑测试、发 PR,卡住才问人
    • Agents Window​ 统一收口:桌面/CLI/Web/iOS/Slack/GitHub 发起的 agent 全在一个侧栏,实时状态、中途介入、本地↔云端一键 handoff(消息前加 & 推云)
    • Cloud Agents:Cursor 基础设施上跑,99.9% 可靠性,产截图/demo,适合长任务(大重构/迁移)后台跑
    • Multi-root workspace(3.2):单 agent 会话跨多文件夹/多 repo

    Composer(不是单独“2.0 功能”,是模型+面板)

    • Composer 面板 = 多文件自主编辑界面;底层模型从 Claude/GPT 代理换成自研 Composer 2.5
    • 支持 /worktree 隔离分支、Plan Mode 出 Mermaid 图、Debug Mode 运行时插日志反推根因

    多端入口

    • 桌面 IDE(Mac/Win/Linux,VS Code 插件兼容 Open VSX)
    • Cursor CLI:终端跑 agent、headless 进 CI
    • Web:cursor.com/agents 审 diff、合 PR、管云 agent 环境
    • iOS App:收件箱跟 8 个 agent、Live Activity + Dynamic Island、语音转写、图片指点、Slack MCP 接进来
    • Slack @Cursor:频道里 @ 它贴报错/Issue,云 agent 接手修,结果回 Slack

    多 Agent 协作与裁判

    • 可并行跑多个 agent(不同模型/不同子任务),/best-of-n 同 prompt 多模型比对
    • Judge Agent(2.2 引入并延续):并行结果自动评估、推优解、附评语,一键采用

    生态

    • MCP 原生(GitHub/GitLab/Slack/DB/浏览器)
    • BugBot(PR 自动审查)、Automations(类定时任务,3.5 起进 Agents Window)
    • Rules / Skills / Subagents / Hooks 文件级配置,兼容 AGENTS.md
    • JetBrains 通过 ACP 协议接入,不止 VS Code 系

    安装与起步(2026 正确)

    # 桌面:cursor.com/download 下 Mac/Win/Linux 安装包
    # CLI(如已装)
    cursor-cli login
    cursor-cli "为订单模块补单测并跑通"
    
    # IDE 内:Cmd/Ctrl+L 聊天,Cmd/Ctrl+K 行内,Agent 切到 Composer 面板或 Agents Window
    # 设默认模型:Settings → AI → Chat Model = Auto / Composer 2.5 / claude-opus-4.8 ...

    规则文件:项目根 .cursor/rules/ 或全局 ~/.cursor/rules/;MCP 在 Settings → MCP 加。


    定价(2026-07,credit-pool 混合制)

    计划价格额度与重点
    Hobby$02,000 Tab 补全 + 50 慢速 premium 请求/月,基础索引
    Pro$20/月无限 Tab + $20 Agent credit 池​ + Auto/Composer 无限档 + 全模型
    Pro+$60/月$70 池 + 3× 模型速率
    Ultra$200/月$400 池 + 20× 速率 + 新功能优先
    Teams$40/人/月集中管理、共享 rules/commands、Cursor Token Rate $0.25/MTok
    Enterprise定制SCIM、审计、GovCloud、发票

    超池按底层模型价续费(Composer 2.5 标准 $0.50/$2.50,Opus 4.8 $5/$25 等)。

  • Kiro下载

    Kiro下载

    亚马逊公司推出的 AI IDE

    Kiro 是什么

    Kiro 是 AWS 推出的 agentic 开发环境(IDE + CLI + Web + 后台 Autonomous Agent),2025-07 预览、2025-11-17 GA,定位是 “从 vibe coding 到 agentic engineering”——核心哲学是 Spec-Driven Development(规格驱动开发):先把自然语言需求转成 requirements.md / design.md / tasks.md 三件套并人工审签,再派 agent 实现,代码只是 spec 的构建产物。

    它是 Amazon Q Developer IDE 插件的继任者(Q Developer 新注册 2026-05-15 关停,IDE 插件 2027-04-30 EOL)。

    当前可用模型(2026-07,通过 Bedrock / 直连路由)

    • Auto(默认):按任务复杂度在下方模型间路由,平衡质量/延迟/成本
    • Claude Opus 4.8 / 4.7 / 4.6 / 4.5(1M 上下文,4.5 为 200K)
    • Claude Sonnet 5 / 4.6 / 4.5 / 4.0(Sonnet 5 与 4.6 均 1M)
    • Claude Haiku 4.5
    • GPT-5.6 Sol / Terra / Luna(272K,首次引入 OpenAI 系)
    • 开源权重:DeepSeek 3.2 / MiniMax M2.5 / M2.1 / GLM-5 / Qwen3 Coder Next
    • 免费档(50 credits)可用 Claude Sonnet 4.5 + 开源权重;付费档解锁 Sonnet 4.6 / Opus 4.8 等 premium

    核心能力(2026 实测)

    Spec-Driven Development(SDD)

    • 自然语言 → EARS 记号需求 → 架构设计(读库分析)→ 带依赖顺序的 tasks.md
    • 三文件落盘在 .kiro/ 或仓库内,可版本化、可 PR 评审、可审计,代码漂移会触发 re-sync 或 spec 更新
    • 比“先聊天再构建”强在:代码写之前意图已被锁定,PM/架构师可读 spec 而非读 diff

    Agent Hooks(事件驱动自动化)

    • 触发点:file:save / file:create / file:delete / before-or-after prompt / before-or-after tool / agent stop / spec task 前后 / 手动
    • 动作:跑预定义 agent prompt 或 shell 命令
    • 典型:存 .ts 自动补单测、改 schema 自动更迁移脚本、commit 前跑安全 lint、spec 改了自动刷 README
    • 配置存 .kiro/hooks/ 进版本库,团队共享同一套纪律

    Steering 文件

    • ~/.kiro/steering/(全局)+ .kiro/steering/(项目级),Markdown 写规范/架构决策/禁区,等价于 Claude Code 的 CLAUDE.md[](@replace=10001)、Codex 的 AGENTS.md[](@replace=10002)

    多表面与执行模式

    • Kiro IDE:Code OSS fork,兼容 VS Code 设置 / 主题 / Open VSX 插件,不是全量 VS Code Marketplace
    • Kiro CLIkiro-cli,bash/zsh/fish,本地或 SSH 远端,headless 可进 CI 审 PR
    • Kiro Web:app.kiro.dev,后台 agent 跑长任务
    • Autopilot(自主)vs Supervised(每步改文件前问)双模式

    正确性验证

    • 需求矛盾/缺口自动推理检查
    • Property-based tests(类 fuzz)断言跨输入不变式,补单测覆盖不到的边角
    • 可接 Figma / Terraform / MCP 拉外部上下文

    生态

    • 原生 MCP(含 AWS MCP、GitHub、DB)
    • 兼容 Agent Client Protocol (ACP),可把 Kiro agent 带进别的工具
    • 支持 AGENTS.md / Skills.md 兼容读取
    • 企业端:IAM Identity Center SSO、SAML/SCIM、GovCloud(2026-02 起,贵 ~20% 无免费档)

    安装与起步(2026 正确)

    # CLI 安装
    # macOS / Linux
    curl -fsSL https://cli.kiro.dev/install.sh | bash
    # Windows
    irm 'https://cli.kiro.dev/install.ps1' | iex
    
    kiro-cli login        # GitHub / Google / AWS Builder ID / IAM Identity Center
    cd your-repo && kiro-cli
    kiro-cli settings chat.defaultModel claude-opus-4.8   # 设默认模型
    /model set-current-as-default
    
    # IDE:kiro.dev/downloads 下 Mac/Win/Linux 安装包
    # Web:app.kiro.dev 登录即用

    写规则:仓库建 .kiro/steering/,hooks 写 .kiro/hooks/,spec 触发后生成 requirements.md / design.md / tasks.md


    定价(2026-07,credit 制)

    计划价格额度模型范围
    Free$050 credits​ 永久Sonnet 4.5 + 开源权重(限流)
    Pro$20/月1,000 credits+ Sonnet 4.6 / Opus 4.8 等 premium
    Pro+$40/月2,000 credits同上
    Pro Max$100/月5,000 credits同上
    Power$200/月10,000 credits同上
    超额$0.04/credit团队/个人通用
    GovCloud商业价 ×1.2无免费档IAM Identity Center 必选

    首次升付费档送 $20 抵扣(社交/Builer ID 登录)。1 credit 在 Auto 下 ≈ 一次中等请求;Opus 4.8 乘 2.2×,Qwen3 Coder Next 乘 0.05×。