Foldseek 集群使用方法
Foldseek 是用于蛋白质三维结构快速比对和数据库搜索的工具,可用于查找相似结构、辅助功能注释和开展蛋白质结构聚类。智算平台已将 Foldseek 封装为 CHESS 应用,应用名称为 BatchFoldseek,用户可以通过图形界面选择输入目录、目标数据库和计算资源并提交作业。
适用场景
本页面介绍通过 CHESS 提交 Foldseek 批量搜索任务的方法。使用图形界面时不需要手动编写 Slurm 脚本。
使用前准备
登录 CHESS 平台
访问 CHESS 平台并使用本人账号登录:
https://webhpc.tibhpc.net/#/login
准备输入和输出目录
提交前,请把需要检索的 PDB 结构文件上传到集群中的同一目录。例如:
/hpcfs/fhome/用户名/foldseek/input/建议为结果单独建立输出目录,避免与输入文件或其他任务的结果混在一起:
/hpcfs/fhome/用户名/foldseek/output/请确认当前账号对输入目录有读取权限,并对输出目录和临时目录有写入权限。
通过 CHESS 提交作业
下载 BatchFoldseek 应用
登录 CHESS 后进入“应用中心”,在“生物医学”或“机器学习”分类中找到 BatchFoldseek,点击下载按钮将应用添加到桌面。

填写作业参数
从 CHESS 桌面打开 BatchFoldseek,在“提交”页面填写作业参数。

主要参数说明如下:
| 参数 | 说明 |
|---|---|
| 作业名称 | 用于区分本次任务,建议填写简短且有意义的名称 |
| 计算队列 | 选择本次任务使用的 CPU 队列 |
| CPU 核数 | 分配给任务的 CPU 核数,可根据数据库数量和任务规模调整 |
| 内存大小 | 分配给任务的内存,页面中的单位为 MB |
| 输入 PDB 目录 | 存放待检索 PDB 结构文件的集群目录 |
| 结果输出目录 | Foldseek 比对结果和作业脚本的保存目录 |
| 临时目录 | 运行过程中存放临时文件的目录;不确定时可使用本人目录下的独立目录 |
| 比对数据库 | 选择一个或多个目标结构数据库 |
资源配置
页面提示:单个数据库的比对任务建议使用 4~24 个 CPU 核,并预留约 3~5 GB 内存;同时选择多个数据库时,应根据数据库数量和输入规模适当增加计算资源。
确认目录、数据库和资源配置无误后,点击右下角“提交”。
查看作业状态
提交成功后,打开应用左侧的“作业组”,查看作业编号、状态、队列、CPU 数量和提交时间。一个批量任务可能包含多个子作业,编号后的括号表示该作业组中的任务数量。

完整操作过程如下:

查看结果
任务完成后,结果会写入提交时指定的输出目录。示例目录内容如下:
0
1
2
AF-A7MCY6-F1-model_v4-afdb_proteome_aln.tsv
AF-A7MCY6-F1-model_v4-afdb_swissprot_aln.tsv
AF-A7MCY6-F1-model_v4-pdb_aln.tsv
AF-A7MCY6-F1-model_v4.pdb
slurm-276218_0.out
slurm-276218_1.out
slurm-276218_2.out
submit_job.sh其中:
*_aln.tsv:Foldseek 结构比对结果;文件名中会包含所选数据库名称slurm-*.out:各子作业的标准输出日志,可用于检查运行过程或定位错误submit_job.sh:应用自动生成的作业提交脚本
可以在 CHESS 文件管理器中下载结果,也可以登录集群后使用命令行查看:
cd /hpcfs/fhome/用户名/foldseek/output
ls -lh
head AF-A7MCY6-F1-model_v4-pdb_aln.tsv常见问题
提示输入目录不存在
确认填写的是集群上的完整路径,并检查 PDB 文件是否已上传到该目录。不要填写本地电脑上的路径。
提示没有权限
确认输入目录对当前账号可读,输出目录和临时目录对当前账号可写。建议优先使用本人家目录下的文件夹。
输出目录中没有比对结果
先在“作业组”中确认所有子作业是否已完成,再检查输出目录中的 slurm-*.out 日志。常见原因包括输入目录为空、PDB 文件格式不正确、目录权限不足或资源不足。
同时选择多个数据库后运行较慢
每个数据库都需要执行独立的比对任务。可以适当增加 CPU 和内存,或者分批选择数据库提交任务。
