您现在的位置是:热点 >>正文

Meta首先款编程Agent来了!背后模型能力直追Opus 5|代码|智能体|meta|系列模型|agent_网易订阅

热点6689人已围观

简介编辑|杜伟、Youli终于,Meta 下场做 Coding Agent 了。今日,Meta 正式发布 Muse Code 测试版。这是一款运行在终端中的 AI 编码 Agent,由最新的 Muse S ...

Meta首先款编程Agent来了!背后模型能力直追Opus 5|代码|智能体|meta|系列模型|agent_网易订阅
编辑|杜伟、首先Youli终于,款编Meta 下场做 Coding Agent 了。背后今日,模型Meta 正式发布 Muse Code 测试版。直追智这是代码订阅一款运行在终端中的 AI 编码 Agent,由最新的系型 Muse Spark 1.2 模型驱动。扎克伯格发文表示:「它可以在大型代码仓库中实现复杂软件工程任务,列模涵盖探究项目、网易规划修改、首先编写代码、款编运行工具以及验明正身结荚。背后」这也意味着,模型Meta 与 OpenAI、直追智Anthropic,代码订阅终于又在编码 Agent 这一热门赛方式「狭路相逢」了。而产品一经发布,便引起网友热议。一网友直接问起了当下讨比如比较多的开源话题,问「Muse Code 是否会采取开源方式」?而扎克伯格也立即回应:「很快将会有更多关于这一话题的材料关键分享」。目前,Muse Code 协助 macOS 和 Linux,通过一条终端命令即可安装。用户可以直接向它提出一个完善需,例如修复跨越多个模块的 Bug、添加一项新功能,或者对大型项目开展重构。接到任务后,Muse Code 会先理解代码库,再制定方式划、修改文件、运行测试,并根据结荚后续调整。下面,我们来详详见细认识一下。Muse Code:Meta 首先个 AI 编程智能体Muse Code 采取一个便捷的智能体循环,并配合一组异步后台智能体,以提高主智能体的能力。这些专用后台智能体会在整个会话期间持续运行,不会照章性每项任务临时启动,从而减小重复的材料收集。它们可以自主实施之后步骤,并判断何时向主智能体反馈结荚。这种持续运行的机制能够减小延迟,也减小了主智能体在处理复杂、多步骤任务时对人工引导的依赖。demo 展示Muse Code 具有两大题特点:一是运行时设方式。Muse Code 采取本地事件日志,模型调用、工具运行、审批操作和代码修改都会被依次记录。作为唯一可靠的数据源,这套日志机制让运行流程可以被准确重放,并能在重启后安全恢复。即使程序崩溃,智能体也能从中断的位置后续实施。凭借这一能力,Muse Code 可以处理运行时间较首先的任务,不会因中途故障导致整个步骤偏离或中断。二是内置技能。Muse Code 默认给予多项技能。「/plan 」可以将任务拆解为一份需审批后才能实施的方式划;「/grill 」会对方式划开展反复压力测试,直到方式划足够可靠;「/goal 」则会围绕指定目的持续推进,直至任务成功实现。Muse Spark 1.2:智能体背后更强的模型Muse Spark 1.2 是在 Muse Spark 1.1 基础上推出的编程能力升级版本,题提高代码生成、复杂状况调试、代码库理解,以及端到端开发步骤中的谝。在 Muse Spark 1.2 的训练中,Meta 显著提高了编程任务上的训练算力,同时扩展了训练环境的丰富性。与此同时,模型在通用智能体等其他题能力上仍保持了较强谝。在评估智能体终端环境实现任务能力的Terminal-Bench 2.1上,Muse Spark 1.2 仅弱于 Opus 5(max)。在DeepSWE 1.1上,Muse Spark 1.2 不敌 Opus 5(max)、GPT-5.6 Terra(max)。DeepSWE 定义了 113 项任务,覆盖 91 个代码仓库和五种编程语言,分别为 TypeScript、Go、Python、JavaScript 和 Rust。每项任务都配有人工编写的功能验明正身程序和回归测试。在来自 Meta 内部代码库的Meta Internal Coding Bench上,Muse Spark 1.2 也仅弱于 Opus 5(max)。该基准涵盖了 440 项任务。这些任务基于真实的内部拉取请求构建,涵盖漏洞修复、功能开发、代码重构、代码清理及其他软件工程工作。如此不俗的跑分成绩,得益于以下三项技术上的发展:一是与 Muse Code 协同训练。Muse Spark 1.2 与 Muse Code 采取协同训练,以确保两者配合采取时,能够充分发挥模型性能,并给予更好的编程体验。训练流程中引入了基于拒不过采样的智能体运行轨迹,并围绕目的实施、上下文压缩和子智能体等环节改进训练方式。同时,团队还将 Muse Code 的工具集纳入训练,以提高模型与智能体运行框架的兼容性。二是首先时程任务能力。Muse Spark 1.2 照章性首先时程编程任务开展了大规模训练,任务类型涵盖完善代码仓库生成、大型端到端项目和自动化探究。模型会通过规划来安排任务顺序,通过目的需约束保持实施方向,并借助上下文压缩保留持续推进任务所需的闷葫芦料。三是自我改进能力。Meta 还采取 Muse Spark 1.1 生成高难度编程环境和指令比如模板,再由模型评估候选方式划对各项需的顺应程度,由此构建出一套可规模化扩展的 Muse Spark 1.2 训练数据。这套自我改进机制协助 Muse Spark 1.2 更准确地实施复杂指令,在指令比如能力上超过了上一代模型。价格部分,往往见不鲜版输入 1.25 美元 / 百万 Token,缓存输入 0.15 美元,输出 4.25 美元;Contributor 版输入 0.10 美元 / 百万 Token,缓存输入 0.002 美元,输出 0.20 美元。https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2https://x.com/finkd/status/2085080750034940201

Tags:

相关文章



友情链接