Jev被请下王座:StartLux开源决策模型27B,38项基准31项反超

AI资讯19秒前发布 EdgeClaw
0 00

开源模型登顶决策基准

9月30日,一款决策模型正式发布,迅速引发关注:在Decision Index 0.2.1的38项基准测试中,它有31项成绩超过当前最热门的Jev,综合得分63.88对57.91,领先公开榜首近6分;而且,它完全开源。拿出这款模型的公司,是成立不到5个月的上海AI明星企业StartLux(原点星辉)。

数字说话:36局国际象棋赢下35局

先看实战。StartLux-Decision-27B与Jev 1.13对弈国际象棋,双方看到相同棋盘状态,不借助额外搜索,每一步都由模型直接选择。最终27B完成将死,平均损失、最佳着法命中率和失误次数等指标全面占优,36局中赢下35局。

在独立的Decision Index 0.2.1中,27B版本得分63.88,38项基准里有31项高于Jev 1.13;在另一套来自上海AI实验室Intern-Decision团队的七项测试中,27B平均准确率达91.82%,高于Jev的88.74%和Intern-Decision-4B的90.02%。需要说明的是,前者是StartLux基于公开评测工具、对照9月28日榜单快照的自测结果,两套口径相互独立。

此次一口气推出0.8B、2B、4B、9B和27B五档版本,并提供BF16、Q8_0、Q4_K_M三种GGUF量化文件。以4B为例,Q8_0文件约4.48GB,在231道公开JevBench量化复测中与原始权重决策一致率达100%;压缩至约2.71GB的Q4_K_M版本后,一致率仍有98.3%。

StartLux-Decision决策引擎对多个候选选项进行高频判断与数据分流

为什么Agent需要专用”决策模型”

决策模型瞄准的是智能体执行任务时大量重复出现的判断:下一步点哪个按钮、调用哪个工具、当前任务是否完成。这些问题的候选项往往已经明确,但每一步等待仍会累积,拖慢整体执行效率。

StartLux-Decision接收当前状态和候选项,支持选择题、是非题与等级评分。对于常规请求,它可以通过一次前向计算返回多个问题的判断及选项概率,无需逐字生成回答文本。例如,同一条客服工单可以同时对应三个问题:应交给哪个团队、是否需要当天处理、影响程度如何。执行程序拿到结构化结果后继续分流或操作;需要撰写回复、展开复杂规划时,再由通用模型接手。

性能上,单张H200、BF16精度和短请求条件下,4B版本一次回答三个问题平均耗时26毫秒,0.8B与2B版本分别只有12.2毫秒和15.5毫秒。

3天研发:AI参与”造AI”

StartLux-Decision-27B与Jev对弈国际象棋36局赢下35局的AI博弈场景

更引人关注的是研发速度。据团队介绍,完成StartLux-Decision的研发与验证全程仅用3天,支撑这一速度的是正在建设的Auto Research方法——它属于RSI(递归式自我改进)体系,让AI参与”假设—实验—验证—新假设”的循环:分析上一轮失败、构造数据、执行训练与评测,再提出下一轮值得尝试的改进。研究目标、评价标准和关键取舍仍由人类研究员把关。

这是StartLux第二次震惊业界。此前StartLux-27B本地模型在工信部中国信通院测试中超过284B的DeepSeek-V4-Flash,并以约1/60的参数量基本打平DeepSeek-V4-Pro。应用演示中,StartLux-Decision被接入模拟网店完成商品筛选和下单,还在《星际争霸II》中为人族机器人选择建造目标、兵种优先级与攻防策略。

高频小判断成为行业共识

StartLux-Decision登顶背后,是行业的一种新共识:智能体系统里调用最频繁的,恰恰是那些高频、候选明确的小判断——它们值得一层专用、低成本、毫秒级响应的智能来承载。从OpenAI开发者日发布的Decisions API,到Cloudflare开源的决策模型Clef,再到更早走红的Laya与持续升温的Personal Agent,这条路线正在被密集验证。

目前StartLux已公开模型权重、相关代码和评测结果,Auto Research仍作为内部研发环节运行。现有测试主要反映公开基准和受控环境中的表现,模型在更复杂任务中能否持续作出可靠判断,仍需后续实验和实际应用检验。按照规划,基于备案进度,StartLux首个面向公众的本地智能体验版本有望在年内推出——届时,这套”让AI参与改进AI”的设想将第一次接受完整检验。

© 版权声明

相关文章