六维教程

EdgeOne Makers AI 模型概览

AI 模型能力正在成为现代应用的标配,但自己部署 GPU 服务器成本高、运维复杂。EdgeOne Makers 提供了托管的 AI 模型服务,几行代码就能调用主流大模型,按调用次数计费,不用管基础设施。这篇讲清楚 EdgeOne Makers 的 AI 模型服务能力、支持的模型类型、调用方式。

AI 模型服务能力

EdgeOne Makers 的 AI 模型服务是托管的推理平台,模型跑在平台的 GPU 集群上,你只需要写代码调用,不用关心硬件、模型部署、扩缩容。

核心能力:

能力 说明
模型托管 平台预置主流大模型,开箱即用
按量计费 按调用次数和 token 数计费,不用不买
全球加速 推理请求自动路由到就近节点
标准接口 统一的 API 格式,切换模型只需改参数
无需 GPU 不用自己买显卡、装驱动

和自建推理服务对比:

对比项 自建 GPU 服务 EdgeOne Makers AI
硬件 自己采购或租用 GPU 平台托管,按量计费
模型部署 自己下载权重、配置环境 平台预置,直接调用
扩容 手动加机器 自动扩缩
启动延迟 冷启动可能几十秒 几乎零冷启动
调用方式 自己封装 HTTP 或 gRPC 标准 API,几行代码

支持的模型类型

EdgeOne Makers 支持多种类型的 AI 模型,覆盖主流应用场景。

文本生成模型

用于对话、问答、摘要、翻译等任务。支持 GPT、Claude、Llama、Qwen 等主流模型。

模型 厂商 特点 适合场景
GPT-4o OpenAI 多模态,能力强 复杂对话、长文本
GPT-3.5-turbo OpenAI 速度快,成本低 日常对话、轻量任务
Claude 3.5 Sonnet Anthropic 长上下文,推理强 长文档、复杂分析
Llama 3.1 70B Meta 开源,性能接近 GPT-4 通用对话、摘要
Qwen 2.5 72B 阿里 中文能力强 中文场景

图像生成模型

用于文生图、图像编辑等任务。

模型 厂商 特点 适合场景
DALL-E 3 OpenAI 质量高,理解力强 创意设计
Stable Diffusion XL Stability AI 开源,可定制 批量生成

Embedding 模型

用于文本向量化,支持 RAG、语义搜索等场景(落地做法见 EdgeOne Makers RAG 与知识库)。

模型 厂商 维度 适合场景
text-embedding-3-small OpenAI 1536 通用嵌入
text-embedding-3-large OpenAI 3072 高精度搜索
bge-large-zh BAAI 1024 中文场景

调用方式说明

调用 AI 模型分三步: 创建函数、绑定 AI 资源、编写调用代码。

第一步: 创建函数

在 EdgeOne Makers 控制台创建一个 Cloud Functions,因为 AI 推理需要完整的运行时环境。

第二步: 绑定 AI 资源

在函数配置文件中声明 AI 绑定:

{
  "name": "ai-demo",
  "bindings": {
    "ai": {
      "name": "AI"
    }
  }
}

配置后,代码里就能通过 env.AI 访问 AI 服务。

第三步: 编写调用代码

export default {
  async fetch(request, env) {
    // 调用文本生成模型
    const response = await env.AI.run("@openai/gpt-3.5-turbo", {
      messages: [
        { role: "system", content: "你是一个用中文回答问题的助手" },
        { role: "user", content: "用一句话解释什么是边缘计算" },
      ],
    });

    return Response.json(response);
  },
};

返回结果的结构:

{
  "response": "边缘计算是把计算任务放到离数据源更近的地方执行的一种方式。",
  "usage": {
    "prompt_tokens": 25,
    "completion_tokens": 28,
    "total_tokens": 53
  }
}

字段说明:

字段 含义
response 模型生成的文本
usage.prompt_tokens 输入消耗的 token 数
usage.completion_tokens 输出消耗的 token 数
usage.total_tokens 输入加输出的总 token 数

token 是模型处理文本的基本单位,一个中文字大约 1 到 2 个 token,一个英文单词大约 1 个 token。token 数直接影响费用和延迟。

多轮对话

messages 数组可以放多轮历史,模型会参考上下文继续对话。把上一轮的回复作为 assistant 消息加进去就行:

const response = await env.AI.run("@openai/gpt-3.5-turbo", {
  messages: [
    { role: "system", content: "你是一个用中文回答问题的助手" },
    { role: "user", content: "什么是 RAG" },
    { role: "assistant", content: "RAG 是检索增强生成,先检索再生成。" },
    { role: "user", content: "它和微调有什么区别" },
  ],
});

三种角色的分工:

角色 作用
system 设定模型的人设和行为规则
user 用户的提问
assistant 模型之前的回复,用于维持上下文

多轮对话的 token 会累积,历史越长消耗越大。生产环境要控制历史长度,比如只保留最近 5 到 10 轮。

速查卡片

要点 说明
AI 模型服务 托管的推理平台,按量计费
支持的模型类型 文本生成、图像生成、Embedding
调用方式 创建函数、绑定 AI 资源、编写代码
文本生成模型 GPT、Claude、Llama、Qwen 等
图像生成模型 DALL-E 3、Stable Diffusion XL
Embedding 模型 text-embedding-3、bge-large-zh
多轮对话 messages 数组,system/user/assistant 三种角色
token 计费 按输入输出 token 总数计费
上一篇
EdgeOne Makers 数据库存储
下一篇
EdgeOne Makers 模型与厂商