一、固定软件环境与输入文件
提交前记录软件名称、版本、编译器、MPI 或 CUDA 环境、许可证条件和启动命令。输入文件应在小规模任务中完成语法和路径检查,并确认势函数、参数文件、模型权重或外部数据均可从计算节点读取。
- 保存一份可复现的环境清单和启动脚本;
- 使用相对稳定的数据目录,不在临时上传目录直接运行;
- 先用代表性输入验证程序能够产生预期日志与输出。
二、估算核心数、显存、内存与运行时间
资源申请应来自基线测试,而不是直接选择最大规格。记录单节点或单卡运行时的核心利用率、峰值内存或显存、I/O 用量和单位步骤耗时,再判断是否增加节点、GPU、并发任务或壁钟时间。并行规模扩大后,应比较有效加速比,避免通信和数据读取抵消新增算力。
三、检查调度参数与作业目录
核对队列、节点数、每节点任务数、线程数、GPU 数量、内存和最长运行时间。标准输出、错误日志、检查点和最终结果应写入明确目录;长任务需验证检查点能够恢复,并为中间文件预留空间。
四、提交后观察关键运行信号
任务排队时确认原因是否为资源不足、优先级或队列限制;运行后观察日志是否持续更新、资源利用率是否符合预期、存储是否快速增长。出现异常时保留作业编号、启动命令、错误日志和最后一个有效检查点,便于定位问题。
五、回收结果并保留复现信息
任务结束后确认退出状态、结果文件完整性和关键指标,再整理输入、脚本、环境版本、作业参数、日志和结果说明。大文件应按继续计算、归档和可删除三类处理,避免无边界占用项目存储。
如果尚不确定任务需要多少资源,可先查看超算租赁与资源评估服务,提交软件栈、数据规模和期望周期进行初步判断。