GroqCloud是什么
GroqCloud 是 Groq 推出的 AI 推理云平台,使用其专为语言模型推理设计的 LPU 硬件,为开发者提供低延迟、高吞吐的大模型和语音 API。平台可调用 Llama、GPT-OSS、Qwen、Whisper 等模型,适合实时聊天、语音助手、RAG、工具型 Agent、内容处理和批量推理。
GroqCloud 主要提供模型推理,不是通用 GPU 租赁平台,也不代表所托管模型都由 Groq 开发。模型权重和许可证来自各自发布方,Groq 负责托管和 API 服务。模型目录、上下文、预览状态、速度和价格会更新,项目上线前应查询控制台中的当前模型卡。
GroqCloud核心功能
LPU高速推理
LPU 面向顺序生成和可预测执行进行设计,Groq 会在价格页展示各模型的当前 Token 每秒参考值。高速输出尤其适合语音对话、交互式 Agent 和需要快速首字响应的应用。页面速度是特定条件下的参考指标,真实体验还受输入长度、排队、网络、工具调用和输出长度影响。
OpenAI兼容API
Groq API 提供 OpenAI 兼容的聊天、响应、音频等接口,已有 OpenAI SDK 项目通常可以通过修改 Base URL、API Key 和模型 ID 迁移。兼容不等于所有参数完全相同,应核对 Groq 当前支持的模型能力、reasoning、tool_choice、JSON 输出、图片和流式字段。
文本、推理与多模态模型
模型目录覆盖小型低成本模型、较大通用模型和推理模型。开发者可根据任务在价格、速度、上下文与质量之间选择。部分模型处于 Preview,可能更改、限流或下线;生产环境应优先使用正式支持的模型并准备替代模型。
工具调用与Compound系统
支持函数工具调用,也提供带网页搜索、访问网页、代码执行和浏览器自动化的 Compound 系统。Compound 会让一个或多个模型按需选择服务器端工具,模型与工具费用分别计入。工具能访问外部网络或执行代码时,结果仍需验证,并限制可处理的敏感数据。
远程MCP
Groq Responses API 可连接远程 HTTPS MCP 服务,平台负责发现工具、把工具定义交给模型、执行调用并继续生成,减少开发者自行编写多轮工具循环的工作。远程 MCP 当前属于测试阶段方向,第三方服务器会接触传递给工具的参数,应核验服务来源、认证和权限。
语音转文字
GroqCloud 托管 Whisper Large V3 和 Turbo,可进行多语言转写;完整版本还支持翻译为英文。音频接口兼容常见格式,免费层与开发层有不同文件大小限制,并按至少 10 秒计费。大文件可先转为单声道 16kHz 并分段处理。
批处理Batch API
Batch API 适合摘要、分类、评测、数据清洗等不要求即时返回的任务。用户提交批量请求后异步执行,处理窗口可从 24 小时延伸到数天,当前价格比实时按量调用低 50%,并且不占用标准实时限额。批任务应使用稳定请求 ID,便于重试和结果对应。
Prompt Caching
部分模型支持提示词缓存,重复的系统提示词或长前缀命中缓存后,输入 Token 可按更低单价结算。缓存功能本身不额外收费,但只有命中的缓存 Token 才享受折扣。应用应从 usage 字段确认命中情况,不能把全部输入都按缓存价估算。
免费开发层与限流
注册后可使用免费开发额度进行原型测试,不同模型分别设置每分钟请求数、每分钟 Token、每日请求数或每日 Token 上限。限流是动态的账户和模型规则,不应把某一个模型的数字当成全平台永久额度。绑定支付方式并升级后可按量使用更高限额,企业可咨询专属容量与服务。
GroqCloud套餐与使用方式对比
| 方案 | 费用方式 | 主要特点 | 适合用户 |
|---|---|---|---|
| Free免费层 | 免费额度 | 按模型限流,适合开发和测试,不保证生产容量 | 学习API、原型和个人项目 |
| Developer按量付费 | 按输入、输出、音频或工具实际用量 | 更高限额,可用于正式应用;无需固定月套餐 | 独立开发者与成长型产品 |
| Batch API | 对应实时价格的50% | 异步处理,完成窗口较长,不占标准实时限额 | 评测、分类、离线数据处理 |
| Enterprise | 定制报价 | 专属限额、容量、支持或本地化方案按合同 | 大规模与关键业务组织 |
GroqCloud模型价格对比
以下是官方价格页核验时的实时按量参考价,单位为美元/百万 Token。费率与模型状态可能变化,最终以调用时控制台为准。
| 模型 | 输入价格 | 输出价格 | 定位 |
|---|---|---|---|
| Llama 3.1 8B Instant | 0.05美元 | 0.08美元 | 低成本、高速通用任务 |
| GPT-OSS 20B | 0.075美元 | 0.30美元 | 轻量推理与工具任务 |
| GPT-OSS 120B | 0.15美元 | 0.60美元 | 更强推理和复杂任务 |
| Llama 4 Scout 17Bx16E | 0.11美元 | 0.34美元 | 长上下文与多模态方向 |
| Qwen3 32B | 0.29美元 | 0.59美元 | 通用、中文和推理任务 |
| Llama 3.3 70B Versatile | 0.59美元 | 0.79美元 | 较强通用文本能力 |
语音与内置工具价格
| 服务 | 当前参考价 | 计费说明 |
|---|---|---|
| Whisper Large V3 | 0.111美元/小时 | 多语言转写与翻译,单次至少按10秒 |
| Whisper Large V3 Turbo | 0.04美元/小时 | 更低价高速转写,不支持翻译端点 |
| Basic Search | 5美元/1,000次 | Compound基础网页搜索 |
| Advanced Search | 8美元/1,000次 | 更深入的搜索工具 |
| Visit Website | 1美元/1,000次 | 访问并读取网页 |
| Code Execution | 0.18美元/小时 | 按工具运行时间结算 |
| Browser Automation | 0.08美元/小时 | 按自动化运行时间结算 |
Groq API接入教程
- 创建账户与Key:在 GroqCloud 控制台创建 API Key,密钥只保存在服务端环境变量。
- 选择模型:查看当前生产与预览模型,确认上下文、价格、限流、工具与多模态能力。
- 安装SDK:可使用官方 Groq Python/TypeScript SDK,也可使用 OpenAI SDK 并修改 Base URL。
- 发送请求:传入完整模型 ID 和 messages,先测试非流式响应,再开启 streaming。
- 检查usage:记录输入、输出、缓存和工具成本,按实际返回用量核算预算。
- 处理限流:读取响应头和错误码,使用指数退避与抖动,禁止无上限并发重试。
- 接入工具:对函数、Compound 或 MCP 设置参数校验、超时、权限和人工审批。
- 生产上线:设置支出限制、日志脱敏、替代模型、健康检查和质量评估。
适合哪些用户
- 需要低延迟流式输出和快速首字响应的聊天或语音产品;
- 希望用 OpenAI 兼容方式调用开源权重模型的开发者;
- 构建 RAG、搜索、代码工具和多轮 Agent 的应用团队;
- 需要低成本大批量分类、摘要和评测的工程团队;
- 希望比较不同模型速度、质量和成本的 AI 开发者。
优势与注意事项
GroqCloud 的主要优势是推理速度快、API 接入简单、价格透明,并同时提供免费开发层、实时按量、Batch、语音和服务器端工具。对交互式应用,高 Token 输出速度可以明显改善等待体验。
限制是模型目录以 Groq 当前支持的模型为准,不能调用所有商业闭源模型,也不等于可上传任意自定义权重。Preview 模型可能变化,免费限额不适合直接承诺生产 SLA。工具和 MCP 会扩大数据与权限边界;模型生成内容可能错误,涉及关键决策和真实操作必须人工复核。
常见问题
GroqCloud免费吗
提供免费开发层,用于学习和原型测试,但按模型设置限流。需要更高容量时升级为按量付费或联系企业销售。
Groq和Grok是同一个产品吗
不是。Groq 是提供 LPU 与高速推理云服务的公司,Grok 是 xAI 的模型品牌,两者名称相近但产品不同。
Groq API兼容OpenAI吗
支持 OpenAI 兼容接口,很多应用只需修改服务地址、密钥和模型 ID。高级参数仍需按 Groq 文档核对。
GroqCloud支持语音识别吗
支持 Whisper Large V3 与 Turbo 的音频转写,完整版本还能翻译为英文,按音频时长计费。
GroqCloud支持MCP吗
Responses API 支持远程 HTTPS MCP 工具,目前属于测试阶段能力。接入前应审查服务器、认证和数据权限。
桂公网安备45132202000164号