Processando Simulações

Esta seção apresenta os conceitos fundamentais para processar jobs no GridUnesp, desde a preparação do ambiente até o monitoramento da execução.

Importante

O servidor access.grid.unesp.br é exclusivamente para acesso e preparação.

NUNCA execute simulações diretamente no access. Use sempre o sistema de filas (SLURM) para submeter jobs aos nós de processamento.

Fluxo de Trabalho Básico

O fluxo típico de trabalho no GridUnesp segue estas etapas:

  1. Acesse o servidor access (ssh)

  2. Prepare seus arquivos e scripts no /home/

  3. Submeta o job com sbatch

  4. Acompanhe a execução com squeue

  5. Recupere os resultados após a conclusão

Primeiro Job: Exemplo Simples

Vamos criar um job de teste que apenas mostra a data e aguarda 60 segundos.

Passo 1: Crie o script de submissão

primeiro_job.sh
#!/bin/bash
#SBATCH -t 5:00        # Tempo máximo: 5 minutos

date
sleep 60

Passo 2: Submeta o job

sbatch primeiro_job.sh

Passo 3: Verifique o status

squeue -u $USER

Passo 4: Veja o resultado

cat slurm-*.out

Nota

O arquivo de saída segue o padrão slurm-JOBID.out.

Monitorando Jobs

Comando squeue

# Ver todos os jobs
squeue -a

# Ver apenas seus jobs
squeue -u $USER

# Ver jobs em formato detalhado
squeue -u $USER -o "%.18i %.9P %.8j %.8u %.2t %.10M %.6D %R"

Estados dos jobs:

  • PD (PENDING): Aguardando recursos

  • R (RUNNING): Em execução

  • CG (COMPLETING): Finalizando

  • F (FAILED): Falhou

  • TO (TIMEOUT): Excedeu tempo limite

Exemplo de saída:

JOBID    PARTITION        NAME   USER  ST      TIME  NODES  NODELIST
2848879      short  vulcano.sh  spock   R      0:09      1   node011
2841620       long   crucio.sh  vader   R  10:02:40      1   node018

Comando scontrol

Para obter detalhes completos de um job:

scontrol show job JOBID

Exemplo de saída parcial:

JobId=2848879 JobName=vulcano.sh
  UserId=spock(11992) GroupId=enterprise(11006)
  JobState=RUNNING
  RunTime=00:00:18 TimeLimit=00:05:00
  NodeList=node011
  Command=/home/spock/vulcano.sh

Comando scancel

Para cancelar um job:

scancel JOBID

Para cancelar todos os seus jobs:

scancel -u $USER

Sistema de Filas (Partições)

O GridUnesp organiza os jobs em partições baseadas no tempo máximo de execução:

Partições disponíveis

Partição

Limite

Uso recomendado

short

24 horas

Testes, jobs rápidos (padrão)

medium

7 dias

Simulações de média duração

long

30 dias

Simulações longas

gpu

24 horas

Exclusivamente para o uso do servidor com GPUs

Importante

  • Se não especificar, o job vai para a partição short com limite de 24h

  • Ao atingir o limite, o job é automaticamente cancelado (TIMEOUT)

  • Especifique sempre um tempo realista (jobs mais curtos têm prioridade)

Especificando o tempo:

#SBATCH -t 30:00                 # 30 minutos
#SBATCH -t 12:00:00              # 12 horas
#SBATCH -t 2-12:00:00            # 2 dias e 12 horas
#SBATCH -t 30-00:00:00           # 30 dias

Sistemas de Arquivos

Durante a execução, os jobs utilizam diferentes áreas de armazenamento:

Pontos de montagem

Local

Capacidade

Uso

/home/

120 TB

Preparação dos jobs (acesso pelo access)

/tmp/

~180 GB/nó

Jobs de 1 nó (rápido, temporário)

/store/

7 TB

Jobs multi-nó e arquivos grandes

Dica

Consulte Guia Completo de Armazenamento para detalhes sobre como otimizar o uso de cada área.

Resumo dos Comandos Básicos

Comandos essenciais

Comando

Descrição

sbatch script.sh

Submeter job

squeue -u $USER

Ver seus jobs

scancel JOBID

Cancelar job

scontrol show job JOBID

Detalhes do job

sacct -j JOBID

Histórico do job (após finalizar)

Ver também