免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

GEV-26B-Decide 入门教程:一个API调用搞定是/否、评分与多选决策

GEV-26B-Decide 入门教程:一个API调用搞定是/否、评分与多选决策 GEV-26B-Decide 入门教程一个API调用搞定是/否、评分与多选决策【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是一个开源的自适应思考决策模型基于 Gemma-4-26B约 4B 活跃参数构建。它把决策变成了一次标准 API 调用是/否判断、0–5 评分、2–256 个选项的多选一次请求就返回每个选项的校准概率还能在模型不确定时自动想一想再作答。它在 Decision Index 0.2.1 上取得62.48的平衡能力分且单条决策只需约 45 ms。30秒了解一个引擎两种思考模式GEV-26B-Decide 的核心设计是快慢系统就像人脑的 System 1 / System 2模式工作方式典型延迟System 1快速直觉一次前向推理直接输出所有选项的校准概率约 45 msAdaptive thinking自适应思考System 1 置信度低于阈值默认 0.8时自动调用 System 2 逐步推理再与快速答案等权重合并视思考长度而定System 2慢思考原版 Gemma-4 思考模式处理文本与图像约 250 tokens/s关键点思考只在需要时发生。官方在 1,754 道验证题上测得自适应模式只让 47.8% 的请求进入思考却拿到了永远思考96% 的收益整体准确率从 73.3% 提升到 83.4%且概率校准度ECE 0.035完全不变。一个接口搞定三类决策noul / score / choice所有决策都走同一个POST /v1/decide接口只需用kind字段切换类型kind用途输出noul是/否判断如客户是否在要求退款[false, true]两项概率score0–5 分打分如服务质量评分6 档概率分布choice多选一支持2–256 个选项每个选项一项校准概率请求只需提供四要素state决策背景可为文本、JSON 或文本图片混合、question一个问题、options多选时必填、thinkingoff/auto/on。curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: choice, state: A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball., question: How much does the ball cost?, options: [$0.10, $0.05, $1.00, $0.55], thinking: auto}响应包含options、probabilities、choice最可能的选项、choice_index、usage开启思考时还会附带thinking: {used: ..., think_tokens: ...}。想调试加return_reasoning/debug字段即可看到 System 2 的完整推理过程和两套分布。其他实用参数thresholdauto模式下触发思考的置信度阈值默认 0.8think_budget思考 token 上限strategy超过 16 个选项时的读取策略默认tournament分组赛制全部选项都读取、不剪枝。5分钟快速部署下载权重 一条启动命令本地部署只需两步需要一张 80GB 显存的 GPU如 B200 / RTX PRO 6000# 方式一HuggingFace 下载 hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide # 方式二git 克隆仓库 git clone https://gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide # 启动服务vLLM监听 :8000 bash GEV-26B-Decide/serve.shserve.sh 实际调用的是 serve_decide.py——一个标准 vLLM OpenAI 服务额外挂上了POST /v1/decide路由。它只加载一份权重普通请求走 System 2OpenAI 兼容端点/v1/chat/completions带jev-decisionLoRA 模块adapter_vllm/的请求则走 System 1 决策路径。⚠️ 部署注意需要支持 Gemma-4 的 vLLM 版本并应用补丁 patches/vllm-gemma4-lm-head-lora.patchGemma-4 绑定lm_head的 LoRA 支持追求更快思考用MTP1 bash serve.sh开启推测解码System 2 提速约 1.8–1.9 倍247 → 438 tokens/s代价是高并发下 System 1 吞吐下降若绕过服务直接调/v1/completions请显式传top_k: 0和top_p: 1.0否则生成配置的默认采样参数会截断返回的概率。自适应思考怎么用才聪明开与不开的场景官方用真实谜题做了直观验证System 1 单轮 vs 自适应思考谜题问题System 1自适应扫雷哪格一定安全21.0%86.0%Wordle哪个词符合全部颜色反馈52.0%100.0%四子棋哪列能赢或封锁54.0%99.5%数独高亮格填哪个数76.0%99.5%在知识推理基准上收益同样明显GPQA Diamond 42.9% → 78.6%、BBH 75.0% → 92.0%、MMLU-Pro 65.0% → 84.6%、CRUXEval代码67.5% → 90.7%。完整游戏数据见 reports/thinking_games.json决策指数明细见 reports/decision_index_adaptive.json。但也要记住边界开auto科学、数学、代码、逻辑、多跳问答等能逐步校验的推理题保持off意图分类、检索、工具路由——这些任务 System 1 本身就很强如 BFCL 94.4%强行思考收益极小甚至在 BANKING77 上会把 macro-F1 从 88.0 拉到 85.0⏱️思考是有成本的不思考约 0.05 秒8,192 token 的思考最长可达约 33 秒B200 单卡估算。延迟详情见 reports/adaptive_latency_summary.json。调低threshold或think_budget可以用准确率换速度。让概率可信两套温度校准文件模型输出的概率是校准过的System 1 与自适应模式 ECE 均为 0.035这是它区别于普通 LLM 输出的核心价值。仓库提供两套温度文件calibration.json默认值noul 1.003 / choice 1.017 / score 0.999Decision Index 评测所用calibration_gold.json对照标准答案重新校准的版本。如果你要根据置信度门控自动操作例如概率 0.9 才自动执行建议换用它。决策头的结构定义24 槽位布局、softcap 30、读出方式在 judge_config.json 和 head.safetensors 中权重本体见 config.json 与两份分片 safetensors。不止文本图像决策与计算机操作同一套权重、同一个 vLLM 引擎同时吃文本和图片内置 Gemma-4 视觉编码器合成图像测试颜色/形状/数字/红物体判断各 100%VL-RewardBench 78.4%计算机使用截图中每个可点击元素标上编号框System 1 单次决策选下一个点击约 85 ms/步60 个多步任务完成 95%比同家族大模型快 3 倍机械臂抓取仅凭顶部相机画面做左右/上下二选一61 ms/决策支持最长256K上下文128K 内实测定位单句关键信息 100% 正确255 个选项的意图分类仍有 89% 准确率。每回合的原始结果在 reports/demos/cu_results.json 与 reports/demos/arm_servo.json。主要文件速览文件说明serve_decide.py · serve.shvLLM 服务端与启动脚本含/v1/decideadapter/System 1 的 PEFT LoRAtransformers 路径使用adapter_vllm/vLLM 版 System 1主干 LoRA 决策头 lm_head LoRAhead.safetensors · judge_config.json24 槽位决策头与读出配置calibration.json · calibration_gold.json两套温度校准chat_template.jinja · tokenizer.json模板与分词器reports/自适应思考验证、决策指数、延迟与游戏数据patches/vLLM 的 Gemma-4 lm_head LoRA 补丁上线前必读已知局限专家级难题HLESystem 1 低于随机水平思考也只是拉回随机线国际象棋类任务从思考中获益甚微思考在难题上很慢知识推理基准未达 Decision Index 的 1,000 ms 延迟门槛——实时场景请保持thinking: off图像决策是零样本未专门微调超过 128K 的上下文尚未验证英文为主涉及高风险的自动化决策务必用calibration_gold.json做置信度门控。小结GEV-26B-Decide 把判断这件事做成了最简单的 APIstate question options进去校准概率出来不确定时它自己知道该想一想。一条serve.sh即可部署一套权重同时服务快速直觉与深度推理是构建决策型 Agent 的高性价比起点。【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表