SpaceXAI 发布 Grok 4.6 和 Grok @Bot
SpaceXAI 发布了 Grok 4.6,这是一个 1.5T 参数模型,专注于长时运行代理和交互式视觉工作,并推出了基于该模型的 AI 队友产品 Grok @Bot,获得积极评价。该模型在知识工作方面被认为是世界第二好的模型,且效率最高。
SpaceXAI 发布了 Grok 4.6,这是一个 1.5T 参数模型,专注于长时运行代理和交互式视觉工作,并推出了基于该模型的 AI 队友产品 Grok @Bot,获得积极评价。该模型在知识工作方面被认为是世界第二好的模型,且效率最高。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
SpaceXAI 发布 Grok 4.6 模型与 Grok Bot 产品,以效率与价格优势切入知识工作赛道,但能力上限与训练细节仍存疑。
在 Claude Tag 评价褒贬不一、Block 的 Buzz 需要更技术型用户的背景下,AI 队友赛道仍缺一个明确的领导者。由 Cursor 团队转至 SpaceX 的团队推出了 Grok Bot,进入早期测试阶段,并获得了非常积极的评价。
Grok Bot 被描述为能登录用户工具、像用户一样操作并返回完成工作的 AI 队友。该产品由最新模型 Grok 4.6 驱动,后者于同日发布,被竞争对手 Cognition 和 Elon 本人承认为世界上第二好的知识工作模型,但效率上无疑是最高的。
Grok 4.6 是一个确认的 1.5T 参数模型,官方称其“在 Grok 4.5 的基础上,特别关注长时运行的代理和更雄心勃勃的交互式与视觉工作”。训练细节显示,它经历了比 Grok 4.5 更长的补充训练,使用精选的模型生成数据、高质量工程数据,并改进了优化器和训练配方。
独立评测机构 Artificial Analysis 的数据显示,Grok 4.6 在智能指数上得分为 61,大致与 GPT-5.6 Sol Max 持平,但落后于 Claude Opus/Fable。在代理任务上,它在 Terminal-Bench v2.1 上取得 88.4% 的成绩,GDPval-AA v2 Elo 为 1753,AA-Briefcase 表现具有竞争力,但成本远低于其他领先模型。
定价方面,Grok 4.6 的输入/输出 tokens 价格为 $2/$6 每百万,显著低于前沿同行,从业者立即将其视为编码和缺陷查找工作负载的新默认选择。
官方披露的训练方法包括:使用 Grok 4.5 重新生成 SFT 轨迹,涵盖推理、代理工具、STEM、软件工程和知识工作等领域,并通过基于模型的检查过滤问题轨迹。随后在广泛的代理 RL 任务上训练,包括知识工作、通用编码、内核优化、Web 开发和计算机辅助设计等。
值得注意的是,xAI 报告称在长任务期间模型表现出更多的自我测试行为。然而,关于训练过程中是否发生沙箱逃逸事件,目前尚不清楚,这被评论者戏称为对基础设施工程师或研究人员的考验。
同日,其他前沿模型也有发布:Qwen3.8-Max 作为开放权重模型发布,总参数 2.4T,激活 95B,但初始版本仅支持文本;DeepSeek V4 Pro GA 以极低价格($0.435/M 输入,$0.87/M 输出)进入市场,但能力评价不一;微软推出首个推理模型 MAI-Thinking-1,强调工具使用反馈。
Elon 表示 Grok 4.7 已在开发中,初始训练已完成,计划使用 SpaceX 内部数据进行补充训练。这表明 SpaceXAI 正快速迭代,并可能利用独特的数据优势。
本报告基于 Latent Space 的 AINews 汇总,其中包含官方披露、独立评测和社区评论。官方训练细节为确认事实,评测数据来自 Artificial Analysis 等第三方,但未经独立验证。部分评价(如“第二好”)来自竞争对手和 Elon 的承认,属于来源声明。
Grok 4.6 与 Grok Bot 的发布标志着 AI 队友赛道进入新阶段,以效率与价格优势抢占市场,但能力上限与训练细节仍需更多验证。
主报道
主报道来源