作者把官方权重的 ds v4.1f 部署在针对 Ampere 架构适配的 vLLM 版本上,并接入 Pi Agent,用于开发网络安全方向的科研原型。实际运行环境为 8 张 A800 80GB,另外约需 300GB 内存存放 engram。
实际使用中遇到的问题
1. 模型会陷入循环输出
作者多次遇到模型重复输出、无法自行退出的问题;此前使用官方 API 配合 dsh 时也遇到过类似现象,因此这并不是自部署环境独有的问题。当前缓解方式是在 Pi Agent 中加入循环检测插件 @isr4el-silv4/loop-guard,用于发现并中止重复输出。作者在后续讨论中补充,这一版本出现循环的频率确实较高。
2. 凭空生成并不存在的用户指令
模型有时会执行用户没有发送过的指令。DeepSeek Harness 的 GitHub Discussion 中也有人报告了类似问题:
作者暂未找到可靠的本地修复办法,认为仍需等待上游处理。
3. DSML 标签解析或生成失败
DSML 标签本应由解析器转换为结构化工具调用,但偶尔会直接作为 AIMessage 出现在聊天记录中,使 Agent 提前结束当前轮。若把这条异常消息继续留在上下文中,后续 DSML 标签也可能持续出错。
作者无法确定根因来自 vLLM 的 parser 还是模型生成。讨论中有使用者表示,改用 SGLang 后基本没有遇到该问题;作者因此倾向于等待 vLLM 修复。
4. 低思考档位仍可能过度思考
官方的 low 思考深度会映射为 50,而完整范围是 0–100,因此“低”档并不算很低,简单任务仍可能出现持续很久的思考。讨论中也有用户报告简单需求运行约一小时的情况。
部署与复现信息
- 权重:官方 ds v4.1f 权重。
- 推理框架:针对 Ampere 的 vLLM 实现。
- Agent:Pi Agent。
- 硬件:8 × A800 80GB,另需约 300GB 内存用于 engram。
- vLLM 参考实现及启动命令:https://github.com/wtdcode/vllm-backport。
适用边界
这篇记录来自作者数天的个人使用体验,没有提供统一基准、故障复现脚本或问题发生比例。循环检测插件只能缓解重复输出;虚构指令和 DSML 异常目前仍没有确定的通用修复方案。
原作者:grubwithu(Grub)
原帖:https://linux.do/t/topic/2910037