dsh-llm-finetuning
其他 活跃维护

dsh-llm-finetuning

satan9394/dsh-llm-finetuning

提供LLM微调路由能力与算法选型配方,覆盖SFT、DPO、GRPO等主流微调范式,可依据任务场景自动匹配最优微调方案,降低大模型微调的技术门槛与试错成本,设计思路受知名开源项目agents启发。

0
Stars 标星
0
Forks 分支
0
Watchers 关注
0
Open Issues
JavaScript
主要语言
MIT
开源协议
5 KB
仓库大小
1 个月前
最后推送
一键安装扩展 / 插件指令
dsh plugin --profile web add github:satan9394/dsh-llm-finetuning
git clone https://github.com/satan9394/dsh-llm-finetuning.git
git clone git@github.com:satan9394/dsh-llm-finetuning.git
README.md main

dsh-llm-finetuning

DSH(DeepSeek Harness)技能插件:LLM 微调路由与配方。

先判断是否该微调(RAG/提示词出口)、方法路由(SFT/DPO/ORPO/KTO/GRPO+RLVR/CPT)、LoRA/QLoRA 配方、评估先行(eval harness)、量化导出。受 wshobson/agents(38k★ MIT)启发的中文原创精简版。

安装

dsh plugin add dsh-llm-finetuning

触发方式

描述中包含"微调 / fine-tune / LoRA / QLoRA / DPO / GRPO / RLVR / 偏好优化 / 强化训练 / eval harness"等关键词时自动触发。

能力

  • 出口优先路由(易变事实→RAG、未定行为→提示词、稳定知识→CPT+SFT)
  • 方法选型(SFT/DPO/KTO/GRPO 按数据形态)
  • LoRA/QLoRA 配方要点与评估先行纪律
  • 量化导出(FP8/NVFP4/AWQ/GGUF)与质量验证

许可

MIT