豆
访问官网
豆包大模型
字节跳动推出的AI大模型家族,包括视频生成、语音视觉、通用语言模型等
开发平台AI 助手模型与 API 平台聊天助手视频生成官网查看
豆包大模型 是什么
豆包大模型是火山引擎提供的模型服务平台,集合语言、视频生成、图像创作和语音等模型能力。开发者可以在模型广场中按类型了解模型,并通过 API 接入业务,搭建需要文本理解、多模态处理或内容生成能力的应用。
它适合需要组合不同模型能力的开发者和业务团队,工作形态覆盖文本交互、视觉内容创作、语音处理与实时语音交互等方向。选择时应先明确应用主要处理的输入类型和输出目标,再从相应模型类别中评估能力匹配度与接入方式。
豆包大模型 的主要功能
多类别模型
官方平台按语言模型、视频生成模型、图像创作模型和语音模型组织能力,便于根据任务类型选择模型。这样的组合适合需要在同一业务中处理文本、视觉内容和语音数据的应用。
语言与多模态理解
语言模型覆盖通用文本处理,并包含面向编程、智能体和多模态能力的模型方向。官方资料还列出可统一理解音频、视频、图像和文本的全模态模型,适合需要综合处理多种输入的任务。
视觉内容生成
视频生成模型支持以文本或图像作为创作输入,面向动态视觉内容生成。图像创作模型则覆盖图像生成与编辑方向,适合需要制作或调整视觉素材的内容工作流。
语音处理与 API 接入
语音模型类别包含音频生成、语音播客、流式语音识别、录音文件识别和实时语音交互等形态,可对应生成、转写和语音对话任务。平台以 API 方式提供模型接入,开发者可以据此把选定能力连接到自己的业务应用中。