Vertex AI 是由 Google Cloud 提供的统一机器学习(ML)平台,使组织能够大规模构建、训练、部署和管理 Artificial intelligence 模型。该平台于 2021 年 5 月推出,将 Google Cloud 之前的 AI 服务(包括 AutoML 和 AI Platform)整合到单一界面和 API 中。它旨在支持完整的 ML 生命周期,从数据准备和特征工程到模型训练、评估和服务,并集成了用于自定义代码和自动化 ML 的工具。
Vertex AI 构建于 Google Cloud 的基础设施之上,并利用 Google 在 Machine learning 和 Deep learning 方面的研究。它提供对各种预训练模型的访问,包括 大型语言模型 和 生成式 AI 功能,以及使用 TensorFlow、PyTorch 和 JAX 等框架构建自定义模型的工具。该平台被各行业企业用于预测分析、计算机视觉、自然语言处理和推荐系统等应用。
核心组件
Vertex AI 提供多个集成组件,以简化 ML 工作流程。Vertex AI Pipelines 提供无服务器编排服务,用于使用 Kubeflow Pipelines 或 TensorFlow Extended 构建和管理 ML 管道。Vertex AI Feature Store 集中管理特征,使团队能够跨模型共享和重用特征。Vertex AI Training 支持使用自定义容器或托管预构建容器进行分布式训练,而 Vertex AI Prediction 则支持在线和批量预测,并具备自动扩展和模型监控功能。
该平台还包括 Vertex AI Workbench,这是一个基于 Jupyter 的笔记本环境,用于数据探索和实验,以及 Vertex AI Model Garden,这是一个包含来自 Google 及 OpenAI 和 Anthropic 等合作伙伴的预训练模型和基础模型的存储库。这些组件旨在减少 ML 的运营开销,使数据科学家和工程师能够专注于模型开发,而非基础设施管理。
生成式 AI 和基础模型
Vertex AI 的一个重要演进是集成了 生成式 AI 功能。2023 年,Google Cloud 推出了 Vertex AI Generative AI Studio,提供用于调优、测试和部署基础模型的工具。这包括访问 Google 的 DeepMind 开发的模型,如 PaLM 2 及后来的 Gemini,以及 Llama 和 Falcon 等开源模型。该平台支持 基于 Transformer 的 架构,并提供 top-p 采样、top-k 采样 和 温度缩放 等功能来控制模型输出。
Vertex AI 还支持 基于人类反馈的强化学习(RLHF),用于微调模型以符合特定用例。Model Garden 包含专有和开放模型,允许用户将其部署在 Google Cloud 的基础设施上,并具备 模型剪枝 和量化等优化功能。这使 Vertex AI 成为 Amazon Web Services 的 SageMaker 和 Microsoft Azure 的机器学习平台的竞争性产品。
与 Google Cloud 生态系统的集成
Vertex AI 与 Google Cloud 的其他服务深度集成,实现无缝的数据和工作流连接。它原生支持 BigQuery 用于数据仓库和分析,Cloud Storage 用于数据湖,以及 Dataflow 用于流式和批处理。该平台还集成了 Cloud Run 和 Kubernetes Engine,用于在容器化环境中部署模型,以及 Cloud Monitoring 和 Logging 用于可观测性。
对于企业,Vertex AI 通过 Google Cloud 的 IAM 提供身份和访问管理,以及 SOC 2 和 HIPAA 等合规认证。该平台在其训练管道中支持 数据增强 和 课程学习 技术,并在其预构建模型架构中提供 批归一化 和 丢弃 层。这种集成减少了从实验到生产的转换摩擦,这是相对于独立 ML 工具的关键优势。
用例和采用情况
Vertex AI 被广泛应用于各个领域。在医疗保健领域,组织部署模型用于医学影像分析和患者结果预测,通常利用 U-Net 架构进行分割任务。在零售领域,它支持需求预测和个性化推荐。金融机构将其用于欺诈检测和风险建模,而媒体公司则将其应用于内容审核和个性化。
知名客户包括 Wayfair,其使用 Vertex AI 进行产品推荐,以及 Kohl's,其将其用于库存管理。该平台也被 Twitter(现为 X)用于内容排名,以及 PayPal 用于欺诈检测。截至 2024 年,Vertex AI 在其 Model Garden 中支持超过 100 个模型,Google Cloud 报告称每月有数千家企业使用该平台,生成式 AI 工作负载显著增长。
与竞争对手的比较
Vertex AI 直接与 AWS SageMaker 和 Azure 机器学习竞争。与提供更广泛内置算法的 SageMaker 不同,Vertex AI 强调与 Google 研究和 DeepMind 创新的集成,特别是在 大型语言模型 方面。与此同时,Azure ML 与 Microsoft 的企业软件栈紧密集成。Vertex AI 的优势在于其统一的管道和对 生成式 AI 的原生支持,以及其按节点小时计费的定价模式,这对于可变工作负载可能具有成本效益。
然而,一些用户指出,由于功能集广泛,Vertex AI 的学习曲线比竞争对手更陡峭,且文档可能分散。尽管如此,其采用率仍在持续增长,这得益于 Google Cloud 在 AI 基础设施方面的投资,包括由 TSMC 制造的自定义 TPU,其为训练大型模型提供了高性能。
未来方向
Google Cloud 继续扩展 Vertex AI 的功能,重点关注智能体 AI 和多模态模型。2024 年,该平台引入了用于构建可与外部工具和 API 交互的 AI 智能体的功能,并增强了对自定义模型开发中 多头注意力 机制的支持。其路线图包括与 Oracle Cloud 的更深入集成以实现混合部署,以及改进 模型压缩 工具以降低推理成本。
截至 2025 年,Vertex AI 被定位为 Google Cloud AI 战略的核心组成部分,通过其企业级部署选项与 OpenAI 的产品竞争。该平台的演进反映了 Artificial intelligence 的更广泛趋势,从传统 ML 转向 生成式 AI 和自主智能体,使其成为 AI 基础设施市场的关键参与者。
参见
参考文献
Google Cloud 文档和公开公告提供了关于 Vertex AI 功能和更新的详细信息。来自技术出版物的行业分析和用户案例研究提供了对其采用和性能的见解。