S
查看来源StableVicuna
第一个通过RLHF训练的大规模开源聊天机器人
开发平台AI 助手模型与 API 平台聊天助手官网查看
价格信息
暂未收录可核验的公开价格
DevPrice 只整理公开信息,不销售 StableVicuna 订阅;价格与可用性以 StableVicuna 官方为准。
StableVicuna 是什么
StableVicuna 是 StabilityAI 推出的开源聊天机器人模型,定位是通过基于人类反馈的强化学习(RLHF)训练的大规模对话模型。它建立在 Vicuna v0 13B 的基础上,并进一步进行了指令微调与 RLHF 训练,适合希望了解这类训练方法和开源对话模型的用户。
从形态上看,StableVicuna 不是单一的聊天应用,而是一个可供研究、试用和集成的语言模型。它采用经过指令微调的 LLaMA 13B 模型作为基础,围绕对话式输入输出提供聊天能力。开发者、模型研究者以及关注开源聊天机器人的用户,可以据此评估其对话模型路线和训练思路。
StableVicuna 的主要功能
RLHF 对话训练
模型经过基于人类反馈的强化学习训练,将 RLHF 作为其对话模型训练路线的重要组成部分,适合关注反馈驱动训练方法的用户。
指令微调能力
StableVicuna 在基础模型之上进行了指令微调,使模型以遵循指令的方式处理对话输入,适合研究指令调整如何影响聊天模型表现。
LLaMA 13B 基础
该模型采用指令微调的 LLaMA 13B 模型作为基础,明确了 StableVicuna 的模型来源与规模形态,便于用户理解其技术谱系。
Vicuna v0 延展
StableVicuna 是 Vicuna v0 13B 的进一步训练版本,在既有模型基础上加入指令微调和 RLHF,适合比较不同开源聊天模型的训练路径。