我尤其关注两个能够直接支持现有检测工作的项目:
如果能绘制一张“阶段图”,刻画算力成本、测序成本和工具类型等因素之间的权衡,将非常有价值。若还能推测未来变化,或分析这些关系如何随模型规模、模型能力和测序成本变化,则更好。这里的数学主要是算术,但这些计算很有用;它们需要深入理解宏基因组病原体检测的工作方式以及不同 AI 工具的特点。
难度更高、价值也更大的研究,是建立一套理论框架,判断通用大语言模型、蛋白质折叠模型、基因组语言模型、多轨生物基础模型等工具,原则上分别最适合用于病原体宏基因组检测流程的哪些环节。
我设想的项目会先建立这样的检测系统,再对其进行调整和分析:
这是一项探索性项目:我手头没有精确标注每条读段是否应被标记的数据集。我们要探索的是,这种检测方法能否以及如何补充传统方法,带来实际价值。
请注意,等到 MATS 项目开始时,其中一个项目可能已由另一项并行奖学金启动。
Boston
Evan is a research scientist at SecureBio Detection, where he works on computational pipelines and detection methods for uncovering threats in deep metagenomic sequencing data. Prior to transitioning his career into biosecurity, he was the VP of data science and engineering at Zoba, a startup providing optimization services to the shared mobility industry. He holds a PhD in operations research and, in his free time, devotes lots of thought cycles to sourdough pizza.
必备条件:
优先条件:
不太适合的情况:
我会根据 SecureBio Detection 的需求以及与我匹配的研究员情况,决定开展两个大方向中的哪一个。在选定方向内,我会根据自己认为对 SecureBio Detection 有帮助、有趣且相关的内容提供指导;研究员则有自主权,也需要主动负责具体工作方向的选择。