EdgeOne Makers AI 模型概览
AI 模型能力正在成为现代应用的标配,但自己部署 GPU 服务器成本高、运维复杂。EdgeOne Makers 提供了托管的 AI 模型服务,几行代码就能调用主流大模型,按调用次数计费,不用管基础设施。这篇讲清楚 EdgeOne Makers 的 AI 模型服务能力、支持的模型类型、调用方式。
AI 模型服务能力
EdgeOne Makers 的 AI 模型服务是托管的推理平台,模型跑在平台的 GPU 集群上,你只需要写代码调用,不用关心硬件、模型部署、扩缩容。
核心能力:
| 能力 | 说明 |
|---|---|
| 模型托管 | 平台预置主流大模型,开箱即用 |
| 按量计费 | 按调用次数和 token 数计费,不用不买 |
| 全球加速 | 推理请求自动路由到就近节点 |
| 标准接口 | 统一的 API 格式,切换模型只需改参数 |
| 无需 GPU | 不用自己买显卡、装驱动 |
和自建推理服务对比:
| 对比项 | 自建 GPU 服务 | EdgeOne Makers AI |
|---|---|---|
| 硬件 | 自己采购或租用 GPU | 平台托管,按量计费 |
| 模型部署 | 自己下载权重、配置环境 | 平台预置,直接调用 |
| 扩容 | 手动加机器 | 自动扩缩 |
| 启动延迟 | 冷启动可能几十秒 | 几乎零冷启动 |
| 调用方式 | 自己封装 HTTP 或 gRPC | 标准 API,几行代码 |
支持的模型类型
EdgeOne Makers 支持多种类型的 AI 模型,覆盖主流应用场景。
文本生成模型
用于对话、问答、摘要、翻译等任务。支持 GPT、Claude、Llama、Qwen 等主流模型。
| 模型 | 厂商 | 特点 | 适合场景 |
|---|---|---|---|
| GPT-4o | OpenAI | 多模态,能力强 | 复杂对话、长文本 |
| GPT-3.5-turbo | OpenAI | 速度快,成本低 | 日常对话、轻量任务 |
| Claude 3.5 Sonnet | Anthropic | 长上下文,推理强 | 长文档、复杂分析 |
| Llama 3.1 70B | Meta | 开源,性能接近 GPT-4 | 通用对话、摘要 |
| Qwen 2.5 72B | 阿里 | 中文能力强 | 中文场景 |
图像生成模型
用于文生图、图像编辑等任务。
| 模型 | 厂商 | 特点 | 适合场景 |
|---|---|---|---|
| DALL-E 3 | OpenAI | 质量高,理解力强 | 创意设计 |
| Stable Diffusion XL | Stability AI | 开源,可定制 | 批量生成 |
Embedding 模型
用于文本向量化,支持 RAG、语义搜索等场景(落地做法见 EdgeOne Makers RAG 与知识库)。
| 模型 | 厂商 | 维度 | 适合场景 |
|---|---|---|---|
| text-embedding-3-small | OpenAI | 1536 | 通用嵌入 |
| text-embedding-3-large | OpenAI | 3072 | 高精度搜索 |
| bge-large-zh | BAAI | 1024 | 中文场景 |
调用方式说明
调用 AI 模型分三步: 创建函数、绑定 AI 资源、编写调用代码。
第一步: 创建函数
在 EdgeOne Makers 控制台创建一个 Cloud Functions,因为 AI 推理需要完整的运行时环境。
第二步: 绑定 AI 资源
在函数配置文件中声明 AI 绑定:
{
"name": "ai-demo",
"bindings": {
"ai": {
"name": "AI"
}
}
}
配置后,代码里就能通过 env.AI 访问 AI 服务。
第三步: 编写调用代码
export default {
async fetch(request, env) {
// 调用文本生成模型
const response = await env.AI.run("@openai/gpt-3.5-turbo", {
messages: [
{ role: "system", content: "你是一个用中文回答问题的助手" },
{ role: "user", content: "用一句话解释什么是边缘计算" },
],
});
return Response.json(response);
},
};
返回结果的结构:
{
"response": "边缘计算是把计算任务放到离数据源更近的地方执行的一种方式。",
"usage": {
"prompt_tokens": 25,
"completion_tokens": 28,
"total_tokens": 53
}
}
字段说明:
| 字段 | 含义 |
|---|---|
| response | 模型生成的文本 |
| usage.prompt_tokens | 输入消耗的 token 数 |
| usage.completion_tokens | 输出消耗的 token 数 |
| usage.total_tokens | 输入加输出的总 token 数 |
token 是模型处理文本的基本单位,一个中文字大约 1 到 2 个 token,一个英文单词大约 1 个 token。token 数直接影响费用和延迟。
多轮对话
messages 数组可以放多轮历史,模型会参考上下文继续对话。把上一轮的回复作为 assistant 消息加进去就行:
const response = await env.AI.run("@openai/gpt-3.5-turbo", {
messages: [
{ role: "system", content: "你是一个用中文回答问题的助手" },
{ role: "user", content: "什么是 RAG" },
{ role: "assistant", content: "RAG 是检索增强生成,先检索再生成。" },
{ role: "user", content: "它和微调有什么区别" },
],
});
三种角色的分工:
| 角色 | 作用 |
|---|---|
| system | 设定模型的人设和行为规则 |
| user | 用户的提问 |
| assistant | 模型之前的回复,用于维持上下文 |
多轮对话的 token 会累积,历史越长消耗越大。生产环境要控制历史长度,比如只保留最近 5 到 10 轮。
速查卡片
| 要点 | 说明 |
|---|---|
| AI 模型服务 | 托管的推理平台,按量计费 |
| 支持的模型类型 | 文本生成、图像生成、Embedding |
| 调用方式 | 创建函数、绑定 AI 资源、编写代码 |
| 文本生成模型 | GPT、Claude、Llama、Qwen 等 |
| 图像生成模型 | DALL-E 3、Stable Diffusion XL |
| Embedding 模型 | text-embedding-3、bge-large-zh |
| 多轮对话 | messages 数组,system/user/assistant 三种角色 |
| token 计费 | 按输入输出 token 总数计费 |