Anyscale是什么
Anyscale是由Ray创始团队创建的统一AI与机器学习计算平台,面向需要运行大规模Ray工作负载的开发者和企业。它在开源Ray之上增加托管基础设施、优化运行时、可观测性、治理和开发工具。
平台可以从交互开发延伸到数据处理、模型训练、批量推理和在线服务。用户既可快速使用Anyscale托管资源,也可把数据平面部署到自己的云或Kubernetes环境。
Anyscale与Ray的关系
Ray是开源分布式计算框架,负责任务调度、Actor、容错、自动扩缩以及Ray Data、Ray Train和Ray Serve等库。开发者可以自行安装和运维Ray。
Anyscale是商业托管平台,使用优化版Anyscale Runtime运行Ray工作负载,并承担集群生命周期、镜像缓存、监控和生产运维。现有Ray代码通常可以较低改动迁移,但平台服务不等于开源Ray本身。
Anyscale主要功能
Workspaces交互开发
Workspaces提供托管VS Code、JupyterLab和网页终端,让开发者直接连接Ray集群进行实验。也可以从本地VS Code或Cursor连接工作区。
Jobs生产任务
Anyscale Jobs用于提交数据处理、模型训练和批量推理等生产Ray应用。平台负责创建集群、监控任务、保存日志,并支持失败处理、重试、队列和定时运行。
Services在线服务
Anyscale Services基于Ray Serve托管模型和Python应用,提供高可用与零停机升级能力。多个模型可以共享基础设施,并随请求负载扩缩。
自动扩缩
平台可以按不同工作节点类型增加或释放CPU与GPU资源,并支持按需、Spot和预留实例。合理设置最小与最大副本可兼顾可用性和费用。
统一调度与队列
Anyscale调度器可在Jobs、Services和Workspaces之间分配计算资源,并使用优先级和队列控制昂贵加速器。管理员可跨预留、Spot、按需和部分云环境安排回退。
容器与依赖管理
用户通过容器镜像和计算配置定义工作负载环境,平台构建并缓存优化镜像。缓存可加快新节点启动,帮助集群更积极地扩缩。
监控与调试
控制台提供工作区、任务、服务和Ray集群的日志、指标与仪表盘。用户也可以定义自有指标,或把数据连接到现有可观测性系统。
成本跟踪
组织管理员可按云、项目、用户、实例类型和集群查看估算用量,并下载明细。预算功能提供每日或每月提醒,但属于软限制,不会自动停止集群。
CLI、SDK与API
开发者可使用命令行、Python SDK和API提交任务、管理集群并接入CI/CD。自动化凭据应存入密钥管理系统,并遵循最小权限原则。
生成式AI能力
LLM在线推理
Anyscale结合Ray Serve与vLLM提供大语言模型服务能力,重点优化吞吐、延迟和GPU利用率。生产部署仍需进行真实流量压测和容量规划。
微调与分布式训练
Ray Train与集群资源可用于多GPU模型训练和微调。团队应先用小规模数据验证代码、检查点和恢复流程,再扩大资源。
批量推理与多模态数据
Ray Data可以并行处理文本、图像和其他数据,适用于大规模嵌入、离线预测和数据整理。管道应记录输入版本、模型版本和失败数据。
RAG流程
平台可用Ray Data完成文档切分、嵌入和向量库写入,再用Services部署在线检索与生成组件。离线索引和在线服务可以独立扩缩。
AI代理与MCP
开发者可在Ray上编排单代理或多代理工作流,并把MCP服务器包装为Ray Serve部署。每个工具服务可独立扩缩、负载均衡和容错。
Anyscale使用教程
- 创建组织,领取当前可用的试用额度。
- 根据数据位置和网络要求选择Hosted或BYOC。
- 创建Cloud与Project,划分团队和环境边界。
- 准备容器镜像、Python依赖和环境变量。
- 定义CPU、GPU、节点类型和自动扩缩上限。
- 在Workspace中运行小规模Ray应用并查看日志。
- 把稳定代码提交为Job,配置重试、队列或定时计划。
- 需要在线推理时,将应用部署为Service并配置副本。
- 接入监控、告警、身份权限和CI/CD流程。
- 通过用量仪表盘持续检查成本,及时关闭闲置资源。
支持的部署方式
| 项目 | Hosted | Bring Your Own Cloud |
|---|---|---|
| 基础设施 | Anyscale托管 | 客户云或本地环境 |
| 部署范围 | 有限区域、虚拟机 | 多云、多区域、本地,支持虚拟机或Kubernetes |
| 数据位置 | Anyscale托管基础设施 | 客户VPC与数据平面 |
| 计算资源 | Anyscale托管计算 | 可使用现有GPU预留 |
| 结算 | 信用卡月度账单 | Anyscale或AWS、Azure、GCP市场账单 |
| 支持 | 工作时间支持,5个案例提交 | 可提供企业SLA、全天候支持和不限案例 |
适合哪些用户
- AI研究员和数据科学家:扩展实验与模型训练。
- 机器学习工程师:把Ray应用从开发推向生产。
- 数据工程团队:运行大规模数据处理和批量推理。
- MLOps与DevOps团队:统一计算、权限、监控和发布流程。
- 生成式AI团队:部署LLM、RAG、代理与多模态管道。
- 拥有多云或Kubernetes基础设施的企业平台团队。
产品优势
- 由Ray创始团队构建,对Ray工作负载提供深度优化。
- Workspaces、Jobs和Services共享相近配置,开发到生产较连贯。
- 支持CPU与多类GPU混合集群、Spot回退和自动扩缩。
- Hosted适合快速开始,BYOC满足数据驻留与企业网络要求。
- 内置日志、指标、成本分摊和组织级权限管理。
使用限制与注意事项
- Anyscale主要面向熟悉Python、容器、云资源和Ray的技术团队。
- 按用量计费可能随集群扩缩快速增长,应设置资源上限和费用告警。
- 预算是软限制,超过阈值不会自动终止集群或服务。
- 价格页的Anyscale Credits与最终美元账单可能因合同和部署方式不同。
- BYOC仍需要客户配置云权限、网络、Kubernetes和安全责任。
- 生产服务应配置多副本、跨故障域和压测,不能只依赖默认参数。
- 客户代码、模型和数据进入平台前,应审查合同、DPA与数据安全附录。
Anyscale价格
截至2026年8月26日,Anyscale采用按用量付费或承诺合同模式,没有固定月费。新账户页面当前显示可获得100美元Anyscale Credits,资格和有效期以注册页为准。
| Hosted实例所含资源 | 官网参考费率 |
|---|---|
| 仅CPU | AC 0.0135/小时 |
| NVIDIA T4 | AC 0.5682/小时 |
| NVIDIA L4 | AC 0.9542/小时 |
| NVIDIA A10G | AC 1.3635/小时 |
| NVIDIA A100 | AC 4.9591/小时 |
| NVIDIA H、B或GB系列 | 联系销售 |
这些是官网展示的Anyscale Credits参考费率,不应直接当作完整项目总价。实际账单还受节点数量、运行时长、部署方式、云资源、存储、网络、折扣和合同影响。
按量付费与承诺合同
- 按量付费:按实际使用计算,适合试验和波动工作负载。
- 承诺合同:面向稳定或较大用量,可申请规模折扣和支持权益。
- Hosted:由Anyscale提供计算和月度信用卡结算。
- BYOC:使用客户云资源,也可通过云市场或Anyscale结算。
安全与数据位置
Anyscale采用控制平面与客户数据平面分离的双平面架构。BYOC中Ray集群运行在客户云账户或Kubernetes集群,数据可保留在选择的区域。
官方文档称平台具备SOC 2 Type 2,Trust Center还列出ISO 27001证书。认证不能替代客户自己的IAM、网络、密钥、日志和数据分类配置。
开源状态
Ray是开源框架,而Anyscale平台和优化运行时属于商业产品,不能把两者混为一谈。选择Anyscale并不意味着所有平台组件都能自行部署。
Anyscale官方GitHub组织公开教程、模板、Terraform模块、Helm图表和部分集成项目。这些公开仓库有各自许可证,但不代表完整Anyscale平台开源。
常见问题
Anyscale可以免费试用吗?
可以。官网当前提供100美元Anyscale Credits用于开始体验,具体资格、有效期和可用资源以注册账户为准。
Anyscale和Ray有什么区别?
Ray是开源分布式计算框架;Anyscale是在Ray之上提供托管集群、优化运行时、监控、治理和生产工具的商业平台。
可以部署在自己的云里吗?
可以。BYOC支持客户云或本地Kubernetes环境,并可使用AWS、Azure、Google Cloud及相关云市场结算方式。
Anyscale支持哪些AI工作负载?
支持数据处理、分布式训练、批量推理、在线模型服务、LLM、RAG、多模态处理、AI代理和MCP服务等Ray工作负载。
Anyscale如何收费?
采用用量计费或承诺合同,没有固定月费。实际费用取决于资源类型、节点数、时长、部署方式、云成本和合同折扣。
Anyscale是开源平台吗?
不是完整开源平台。开源的是Ray及官方公开的部分教程和集成仓库,Anyscale平台与优化运行时属于商业产品。
桂公网安备45132202000164号