Gemini REST API 是 Google 为开发者提供的一套标准 RESTful 接口,用于在应用程序中集成其最新的 Gemini 系列生成式 AI 模型。它支持文本、图像、音频和视频等多种模态的输入与生成,是构建 AI 应用最直接的方式之一。

核心能力与主要端点
Gemini REST API 围绕几个核心端点构建,以满足从简单查询到复杂代理工作流的不同需求:
Interactions API (推荐):这是自 2026 年 6 月起成为默认的接口,也是未来构建应用的最佳方式。它专为支持代理工作流、服务器端状态管理以及复杂的多模态多轮对话而优化。官方建议所有新项目都应使用此 API。
generateContent API (旧版):标准的非流式 REST 端点,用于处理请求并以单个数据包返回完整响应。目前仍受支持,但已被标记为旧版 (Legacy)。
streamGenerateContent API:通过服务器发送事件(SSE)实现流式响应,可将模型生成的回复片段逐步推送给用户,从而为聊天机器人等应用提供更快速的交互体验。
Live API:基于 WebSocket 的双向流式 API,专为实时对话等低延迟场景设计。
其他端点:还包括用于提交离线任务的批次模式 (batchGenerateContent)、生成文本嵌入的嵌入 (embedContent),以及用于图像生成 (Imagen) 和视频生成 (Veo) 的生成媒体 API。
认证与使用方式
调用 Gemini REST API 非常简单直接。
认证:所有 API 请求都必须包含
x-goog-api-key标头,并附上你在 Google AI Studio 中免费创建的 API 密钥。基本调用:你可以使用
curl命令直接调用 REST 端点。例如,一次典型的 API 调用如下所示:curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \ -H "x-goog-api-key: $GEMINI_API_KEY" \ -H 'Content-Type: application/json' \ -d '{ "model": "gemini-3.7-flash", "input": "用几句话解释一下AI是如何工作的" }'
SDK 支持:除了直接使用 REST API,Google 也为 Python、JavaScript (Node.js) 等主流语言提供了官方 SDK,可以更便捷地集成。
模型选择与定价
Gemini API 提供了多种模型,以满足不同场景对性能、速度和成本的需求。
主要模型:
定价模式:API 按Token计费,而非按请求次数。费用分为输入 Token(你发送的内容)和输出 Token(模型生成的内容)两部分,其中输出 Token 的价格通常是输入 Token 的 4-6 倍。
价格参考:
最新进展:代理能力与更多功能
Gemini API 正在快速演进,以支持更先进的 AI 代理(Agent)功能。
Managed Agents (托管代理):这是 Gemini API 的一项新功能,允许开发者通过单次 API 调用即可创建一个能够进行推理、使用工具,并在隔离的 Linux 环境中执行代码的 AI 代理。
OpenAI 兼容性:为了便于开发者迁移,Gemini API 也提供了与 OpenAI API 兼容的接口。
多模态与工具:最新的模型如 Gemini 3.7 Flash,支持 100 万 token 的上下文窗口,并能将网络搜索作为内置工具。
豫公网安备 41040202000300 号
暂无评论