Processando Simulações
Nesta seção:
Esta seção apresenta os conceitos fundamentais para processar jobs no GridUnesp, desde a preparação do ambiente até o monitoramento da execução.
Importante
O servidor access.grid.unesp.br é exclusivamente para acesso e preparação.
NUNCA execute simulações diretamente no access. Use sempre o sistema de filas (SLURM) para submeter jobs aos nós de processamento.
Fluxo de Trabalho Básico
O fluxo típico de trabalho no GridUnesp segue estas etapas:
Acesse o servidor access (
ssh)Prepare seus arquivos e scripts no
/home/Submeta o job com
sbatchAcompanhe a execução com
squeueRecupere os resultados após a conclusão
Primeiro Job: Exemplo Simples
Vamos criar um job de teste que apenas mostra a data e aguarda 60 segundos.
Passo 1: Crie o script de submissão
#!/bin/bash
#SBATCH -t 5:00 # Tempo máximo: 5 minutos
date
sleep 60
Passo 2: Submeta o job
sbatch primeiro_job.sh
Passo 3: Verifique o status
squeue -u $USER
Passo 4: Veja o resultado
cat slurm-*.out
Nota
O arquivo de saída segue o padrão slurm-JOBID.out.
Monitorando Jobs
Comando squeue
# Ver todos os jobs
squeue -a
# Ver apenas seus jobs
squeue -u $USER
# Ver jobs em formato detalhado
squeue -u $USER -o "%.18i %.9P %.8j %.8u %.2t %.10M %.6D %R"
Estados dos jobs:
PD (PENDING): Aguardando recursos
R (RUNNING): Em execução
CG (COMPLETING): Finalizando
F (FAILED): Falhou
TO (TIMEOUT): Excedeu tempo limite
Exemplo de saída:
JOBID PARTITION NAME USER ST TIME NODES NODELIST
2848879 short vulcano.sh spock R 0:09 1 node011
2841620 long crucio.sh vader R 10:02:40 1 node018
Comando scontrol
Para obter detalhes completos de um job:
scontrol show job JOBID
Exemplo de saída parcial:
JobId=2848879 JobName=vulcano.sh
UserId=spock(11992) GroupId=enterprise(11006)
JobState=RUNNING
RunTime=00:00:18 TimeLimit=00:05:00
NodeList=node011
Command=/home/spock/vulcano.sh
Comando scancel
Para cancelar um job:
scancel JOBID
Para cancelar todos os seus jobs:
scancel -u $USER
Sistema de Filas (Partições)
O GridUnesp organiza os jobs em partições baseadas no tempo máximo de execução:
Partição |
Limite |
Uso recomendado |
|---|---|---|
short |
24 horas |
Testes, jobs rápidos (padrão) |
medium |
7 dias |
Simulações de média duração |
long |
30 dias |
Simulações longas |
gpu |
24 horas |
Exclusivamente para o uso do servidor com GPUs |
Importante
Se não especificar, o job vai para a partição short com limite de 24h
Ao atingir o limite, o job é automaticamente cancelado (TIMEOUT)
Especifique sempre um tempo realista (jobs mais curtos têm prioridade)
Especificando o tempo:
#SBATCH -t 30:00 # 30 minutos
#SBATCH -t 12:00:00 # 12 horas
#SBATCH -t 2-12:00:00 # 2 dias e 12 horas
#SBATCH -t 30-00:00:00 # 30 dias
Sistemas de Arquivos
Durante a execução, os jobs utilizam diferentes áreas de armazenamento:
Local |
Capacidade |
Uso |
|---|---|---|
|
120 TB |
Preparação dos jobs (acesso pelo access) |
|
~180 GB/nó |
Jobs de 1 nó (rápido, temporário) |
|
7 TB |
Jobs multi-nó e arquivos grandes |
Dica
Consulte Guia Completo de Armazenamento para detalhes sobre como otimizar o uso de cada área.
Resumo dos Comandos Básicos
Comando |
Descrição |
|---|---|
|
Submeter job |
|
Ver seus jobs |
|
Cancelar job |
|
Detalhes do job |
|
Histórico do job (após finalizar) |
Ver também
Melhorando o Script de Submissão - Mais opções de configuração
Monitorando Jobs - Monitoramento avançado
Política de Prioridade - Como funciona a prioridade
Boas Práticas - Recomendações de uso