Microsoft libera TauGrid em código aberto para simplificar a gestão de cargas de trabalho de IA no Kubernetes
A Microsoft abriu o código do TauGrid, uma plataforma cloud-native para gerenciar, agendar e monitorar cargas de trabalho de IA em clusters Kubernetes com GPUs.
O que é o TauGrid?
Segundo a Microsoft, o TauGrid é voltado para equipes de engenharia e pesquisa e oferece uma stack unificada. Equipes de plataforma podem usar recursos como workspaces, filas, perfis de computação, armazenamento, identidade e observabilidade, enquanto pesquisadores podem enviar workloads sem precisar aprender Kubernetes.
A plataforma cobre desde a preparação inicial dos dados até treinamento distribuído, fine-tuning e inferência. Construída sobre Kubernetes, usa filas especializadas e agendamento ciente de topologia para gerenciar cargas intensivas de GPU.
Além da CLI tau, o TauGrid inclui Kueue para filas e gestão de recursos, KubeRay para orquestração, monitoramento de saúde dos nós GPU e observabilidade.
“Em vez de construir e manter esses componentes e a integração entre eles separadamente, o TauGrid oferece uma única instalação Helm com limites de propriedade claros.”
Como funciona?
O TauGrid usa um arquivo de configuração YAML, que pode ser enviado com tau run. O comando valida a configuração e cria um Kubernetes Job ou um KubeRay RayJob, que é enfileirado pelo Kueue com base em cota e prioridade. Durante a execução, o TauGrid acompanha status, logs e checkpoints, além de coletar e armazenar evidências de experimentos para reprodutibilidade e diagnóstico de falhas. Se um job falhar, ele pode ser retomado a partir de um checkpoint.
Status e alternativas
O TauGrid ainda está em desenvolvimento, com um roadmap que inclui workspaces multi-tenant, RBAC e cotas, suporte a PyTorch DDP/FSDP, DeepSpeed e fluxos LoRA/QLoRA, gestão do ciclo de vida de datasets, execução multi-cluster/multi-cloud, entre outros.
O código do TauGrid é escrito principalmente em Go, com desenvolvimento aberto no ecossistema Azure. Para rodar, é preciso um cluster Kubernetes (1.30+) com nós GPU, kubectl e Helm 3.0 ou superior.
Alternativas incluem o Kubeflow, que avança para graduação da CNCF como um “sistema de ML maduro e pronto para produção”, e o Nvidia Run:AI.
Fonte: baseado na análise de Sergio De Simone, publicada pela InfoQ. Acesse a matéria original.
Conecte-se
Acompanhe meu conteúdo nas redes sociais ou entre em contato por e-mail.