Infraestrutura

Esta seção descreve os equipamentos que compõem o GridUnesp e a estrutura que dá suporte ao seu funcionamento.

Data Center

Datacenter do NCC/Unesp

O GridUnesp está localizado no Datacenter do Núcleo de Computação Científica da Unesp (NCC/Unesp), no campus da Barra Funda, em São Paulo. Este datacenter abriga não apenas o GridUnesp, mas também outros projetos de importância estratégica para a Unesp e para a comunidade científica.

Projetos no Datacenter

SPRACE (São Paulo Research and Analysis Center)

  • O SPRACE opera uma Tier-2 do Worldwide LHC Computing Grid (WLCG)

  • Processamento e análise de dados do experimento CMS no CERN

  • O GridUnesp nasceu como spin-off do SPRACE

ANSPGrid CA (Academic Network at São Paulo Grid Certification Authority)

  • A ANSPGrid CA emite certificados de grid X509 para pesquisadores desde 2013

  • Baseada em criptografia de chave pública/assimétrica

  • Atende institutos de pesquisa em todo o Brasil desde 2018

Modern Code & Intel CoE for Machine Learning

  • Cluster baseado em arquitetura Intel Many Integrated Core (MIC)

  • Treinamento em OpenMP, MPI e programação paralela

Espelhamento da Reitoria

  • Cópia de segurança dos sistemas administrativos da Unesp

  • Garantia de disponibilidade contínua dos serviços

Repositório Institucional Unesp

  • O Repositório Institucional Unesp é a Biblioteca Digital

  • Armazenamento e preservação da produção científica da Unesp

  • Acesso aberto a documentos, dados e planos de gestão

unespNET

  • A unespNET está conectada à Reitoria e ao NAP do Brasil

  • Conexão por canais ópticos a 100 Gbps

  • Recebe links de unidades do interior (Presidente Prudente, Bauru e Botucatu)

  • Interconexão de 34 unidades universitárias em 24 cidades

  • Aproximadamente 60 mil usuários

  • Datacenter do NCC como ponto de presença estratégico

Base de dados TnCentral e Pesquisa Genômica

  • Implado em 2021 no data center do NCC

  • Banco de dados

    • biológicos sobre elementos transponíveis procarióticos relacionado a

      • resistência bacteriana a antibióticos

      • surtos de doenças em culturas agrícolas e pecuária economicamente importantes

    • públicos e “genome browsers” de todos os genomas de plantas desenvolvidos pelos

      • Laboratório de Genômica e Bioinformática de Plantas e Microorganismos

      • Laboratório de Sistemática e Evolução Vegetal da UNESP-FCAV

  • Colaboração internacional com diversas instituições

    • Unesp

    • Protein Information Resource

    • Multidrug-Resistant Organism Repository and Surveillance Network

    • Walter Reed Army Institute of Research

    • Georgetown University Medical Center

    • University of Delaware

Equipe

A equipe do GridUnesp, integrada aos demais projetos do NCC, reúne especialistas em diversas áreas da computação:

  • Redes e conectividade

  • Hardware e infraestrutura

  • Desenvolvimento de software

  • Programação paralela e otimização

  • Processamento de alto desempenho

  • Análise de dados

  • Segurança da informação

  • Auditoria de sistemas

Atribuições da equipe:

  • Operação 24/7 do Datacenter

  • Aquisição e manutenção de equipamentos

  • Gerenciamento de conexões de internet e rede elétrica

  • Sistemas de refrigeração e segurança

  • Suporte à comunidade científica

  • Administração e gestão de recursos

Além da equipe técnica, o NCC conta com pessoal qualificado na área administrativa para gestão orçamentária e burocrática.

Cluster do GridUnesp

Definições

  • Cluster: Conjunto de computadores trabalhando simultaneamente em tarefas grandes e repetitivas

  • Grid: Conjunto de clusters interconectados de maneira coordenada

O GridUnesp iniciou suas operações como grid, mas atualmente opera como cluster devido à instabilidade da rede KyaTera que conectava os campi.

Operação

  • Em funcionamento desde 2009

  • Regime 24 horas por dia, 7 dias por semana, 365 dias por ano

  • Downtimes esporádicos apenas para instalação de novos equipamentos e manutenções preventivas

  • Alguns equipamentos originais ainda em operação (mais de 15 anos de uso)

Configuração dos Nós

Worker Nodes (Nós de Processamento)

O GridUnesp possui 57 nós de processamento:

  • 56 nós CPU (node001 a node056)

  • 1 nó GPU (gpunode001)

Divisão de Recursos do Cluster (Especialização de Núcleos)

Tipo de Nó

Capacidade Total

Reservado ao SO

Disponível para Jobs

Nós Regulares (node[001-056])

28 Cores / 56 CPUs

2 Cores / 4 CPUs

26 Cores / 52 CPUs

Nó de GPU (gpunode001)

48 Cores / 96 CPUs

4 Cores / 8 CPUs

44 Cores / 88 CPUs

Especificações dos Nós CPU (node001 - node056):

CPU:
  Fabricante: Intel
  Modelo: Intel(R) Xeon(R) CPU E5-2680 v4 @ 2.40GHz
  Arquitetura: x86_64 (64-bit)
  Cores físicos: 14 por socket
  Sockets: 2 (total de 28 cores por nó)
  Threads: 28 (Hyper-Threading habilitado)
  Frequência: 2.40 GHz (base)
  Cache L3: 35 MB

Memória:
  RAM: 128 GB por nó (4 GB/núcleo)

Características:
  - Suporte a AVX2, FMA
  - Virtualização (VMX)
  - Intel Turbo Boost
  - Intel Hyper-Threading

Especificações do Nó GPU (gpunode001):

CPU:
  Fabricante: AMD
  Modelo: AMD EPYC 9224 24-Core Processor
  Arquitetura: x86_64 (64-bit)
  Cores físicos: 24 por socket
  Sockets: 2 (total de 48 cores por nó)
  Threads: 96 (SMT habilitado)
  Frequência: 3.7 GHz (boost)
  Cache L3: 1024 KB por core

GPU:
  Fabricante: NVIDIA
  Modelo: NVIDIA L40S
  Quantidade: 4 GPUs por nó
  Arquitetura: Ada Lovelace
  Memória por GPU: 48 GB GDDR6
  Memória total GPU: 192 GB
  CUDA Capability: 8.9
  CUDA Cores: 18,176 por GPU
  Tensor Cores: 568 por GPU (4ª geração)
  RT Cores: 142 por GPU (3ª geração)

Memória:
  RAM: 1.5 TB

Características:
  - Suporte a AVX-512
  - AMD-V (virtualização)
  - PCIe 4.0/5.0
  - Suporte completo a CUDA, cuDNN, TensorRT
  - Otimizado para Deep Learning, AI e renderização

Nota

Para mais informações sobre uso de GPUs, consulte a seção Uso de GPUs.

Resumo das Especificações

Característica

Anteriormente

Após upgrade

Processamento (TF)

23

77

Armazenamento (TB)

136

288

Núcleos (cores)

2.048

3.232

Detalhamento do upgrade:

  • 56 nós de processamento: 1.568 núcleos, 4 GB/núcleo

  • 1 nó GPU: Processador AMD EPYC 9224

  • 4 servidores de gerenciamento: 12 núcleos/servidor, rede 40 GbE

  • Armazenamento: 288 TB raw (216 TB efetivos) com Lustre

  • Rede interna: 40 GbE entre nós, 2 switches com 32 portas

Aviso

Política de Armazenamento:

  • Não há quotas de disco por usuário ou projeto

  • Não há sistema de backup automático

  • Os usuários são responsáveis por seus próprios backups

Em caso de falha catastrófica, os dados serão perdidos sem possibilidade de recuperação.

Rede

Atualmente, o GridUnesp utiliza rede Ethernet 40 GB/s para:

  • Comunicação entre nós de processamento

  • Comunicação com o storage

Nota

Anteriormente, o cluster utilizava rede InfiniBand, considerada mais rápida porém com custo de manutenção inviável a longo tempo. A migração para Ethernet ocorreu com o upgrade de 2017/2018.

Consumo Energético

O upgrade de 2017/2018 proporcionou uma redução significativa no consumo de energia:

  • Antes: 90 KW/h

  • Depois: 15,8 KW/h

Infraestrutura elétrica:

  • 2 nobreaks para suporte em quedas de energia

  • Gerador a diesel com autonomia para horas de operação

  • Desligamento sequencial programado em caso de falha prolongada

Sistema de Refrigeração

O Datacenter do NCC/Unesp conta com um sistema de refrigeração de alta capacidade, projetado para manter as condições ideais de temperatura e umidade para o funcionamento contínuo e seguro dos equipamentos.

Componentes do sistema:

  • 3 (três) unidades de ar-condicionado do tipo precisão, com capacidade adequada à carga térmica do ambiente

  • 12 (doze) ventiladores de grande porte localizados na área externa do prédio, responsáveis pela dissipação do calor gerado pelos equipamentos

    Sistema de refrigeração
    _images/ventoinha1.jpg _images/ventoinha2.jpg
  • Confinamento do ar frio no corredor onde se concentram os equipamentos de produção mais intensa (corredor frio), o que proporciona:

    • Aumento da eficiência térmica do sistema de refrigeração

    • Redução do consumo energético

    • Melhor controle da temperatura nos racks de alta densidade

Futuras Aquisições

Política de Incorporação

A manutenção de uma infraestrutura como a do GridUnesp demanda:

  • pessoal qualificado

  • atualização dos equipamentos devido à degradação natural e à obsolescência inevitável

O Núcleo de Computação Científica da Unesp tem sempre buscado oportunidade de financiamento junto às agências de fomento para aquisição de novos equipamentos para prover a comunidade científica com maior capacidade de armazenamento, velocidade de processamento e transferência de dados. Com essas ações, o GridUnesp procura fazer com que os recursos computacionais continuem a impulsionar a pesquisa na universidade, abrindo novas fronteiras para a investigação científica na Unesp.

Atenção

Assim, o GridUnesp implantou uma nova política para incorporação de recursos computacionais:

  1. Projetos contemplados com novos equipamentos de Computação de Alto Desempenho (HPC) podem solicitar incorporação ao Datacenter

  2. Prioridade de uso por 3 anos para os recursos incorporados

  3. Após o período, equipamentos são incorporados à estrutura compartilhada

Benefícios:

  • Otimização de recursos financeiros (custo do Datacenter é compartilhado)

  • Renovação contínua da infraestrutura

  • Acesso a tecnologias mais recentes

Serviços Não Suportados

Para melhor planejamento de seu trabalho, é importante conhecer os serviços não disponíveis:

Transferência de Dados:

  • Globus/GridFTP: Não há suporte

  • Alternativas: scp, rsync, sftp, WinSCP (consulte Transferindo Arquivos)

Ambientes Interativos:

  • Jupyter Notebooks: Não há suporte

  • ParaView: Não há suporte em modo interativo

  • Alternativa: Execute análises e visualizações em sua máquina local

Autenticação:

  • Two-Factor Authentication (2FA): Não disponível

  • Acesso feito exclusivamente por senha SSH

Armazenamento:

  • Backup automático: Não disponível

  • Quotas de disco: Não definidas (use com responsabilidade)

Importante

Backup de dados é responsabilidade do usuário.

Como não há sistema de backup, é fundamental que você:

  1. Faça backups regulares de dados importantes

  2. Mantenha cópias em pelo menos dois locais diferentes

  3. Não utilize o GridUnesp como único local de armazenamento de dados críticos

Ver também