Invalid account or account/partition combination specified
Soit vous n’avez pas le droit de calculer sur la partition spécifiée (voir liste des partitions ici), soit vous n’indiquez pas le bon nom d’account Slurm. Le nom de votre account Slurm vous a été envoyé par e-mail avec vos identifiants. Il correspond à votre groupe projet et non à votre compte utilisateur.
Requested time limit is invalid (missing or exceeds some limit)
Le walltime (temps maximal d’exécution) de votre job est supérieur aux limitations de la file choisie avec l’option partition. Voir le walltime maximum de chaque partition ici.
slurmstepd: error: *** JOB … ON … CANCELLED AT … DUE TO TIME LIMIT ***
Le walltime de votre job a été atteint alors que le job n’était pas fini. Slurm arrête automatiquement les jobs lorsque le walltime est atteint. Afin d’éviter cela, vous pouvez augmenter le walltime de votre job ou soumettre votre job sur une partition permettant l’utilisation d’un walltime plus long. Voir le walltime maximum de chaque partition ici. Il est recommandé d’utiliser des points de reprise (checkpoints) dans votre code afin de pouvoir démarrer un nouveau job en se basant sur la sortie du job précédent.
error: QOSGrpCPUMinutesLimit
Unable to allocate resources: Job violates accounting/QOS policy (job submit limit, user’s size and/or time limits)
Deux possibilités :
Votre projet n’a pas été renouvelé. Chaque année, le responsable du projet reçoit plusieurs rappels pour remplir ce formulaire. L’accès est automatiquement suspendu au bout d’un an si le formulaire n’est pas rempli.
Ou :
vous n’indiquez pas le bon nom d’account Slurm. Le nom de votre account Slurm vous a été envoyé par e-mail avec vos identifiants. Il correspond à votre groupe projet et non à votre compte utilisateur.
launch failed requeued held
Slurm a peut être rencontré un problème technique avec une machine de calcul et votre job n’a pas pu être lancé. Il a été remis en file d’attente. Dans ce cas, il vous est recommandé de relancer le job avec la commande suivante scontrol release suivie du numéro de votre job (la première colonne de chaque ligne quand vous faites un squeue). Exemple :
scontrol release 11186528
Some of the step tasks have been OOM Killed.
Votre job est trop gourmand en mémoire par rapport à votre demande Slurm initiale ou aux capacités de la machine (CPU : les voir ici – GPU et SMP : voir ici). Utilisez des options Slurm telles que mem, mem-per-cpu ou mem-per-gpu pour définir votre besoin en mémoire. Si vous n’ajoutez pas l’une de ces options, par défaut Slurm alloue 4,7 Go de RAM par cœur CPU.
Il est recommandé d’utiliser une valeur en Go, toujours légèrement inférieure à la capacité maximale de la machine choisie. Exemple:
#SBATCH --mem=180G
