好的数据应该是怎样的?AI药物发现数据的5V原则

若是你信托机械学习在药物发现和开发方面具有伟大潜力,那就很难绕*的难题——数据。

关于AI药物研发,许多人都意识到数据的主要性,但更多的细节却很难谈起。

本篇文章,LabGenius的首席手艺官Leo Wossnig实验用5V框架界说什么是好的数据,可以天生此类数据的手艺客栈,以及需要哪些头脑方式、团队和文化来实现。希望能够对读者有一些启发。

“好”数据是什么样的?

“好的”数据有两个要害要求:数据的相关性,或者数据转化为临床效果的水平,以及数据的质量。

后者是一个宽泛的术语,但现实上问题在于细节——数据网络、存储、协议、再现性和尺度化等不太理想的事情。

但若是这项事情做得欠好,那么机械学习模子不会事情得稀奇好,最坏的情形可能会完全损失数据完整性,从而导致致命的效果。

探索性数据剖析以确立对数据的基本明晰和严酷的模子验证对于机械学习、生物统计学和生物信息学建模至关主要。这些因素会影响模子的展望准确性。

虽然不准确的统计剖析也会影响盘算机方式的准确性或可靠性,但禁绝确的化学和生物数据仍然是数据驱动的药物发现方式的焦点问题。因此,削减数据天生历程中的噪声并提高一致性是天生高质量数据的要害方面。

然而,随着化学、基因组和卵白质数据集的增进,原始研究中的一些步骤(例如手动数据治理)已变得不切现实。由于数据准备和建模没有在整个行业中尺度化,因此泛起了进一步的挑战。

底层流程和事情流程的尺度化水平较低,从而施加了更基本的限制。构建数据处置方式以对网络的数据举行一致的治理和尺度化是天生高质量数据的另一个主要部门。

但要领会若何网络高质量数据,就得明晰什么是高质量的数据,而且界说它。作者开发一个框架来评估数据自己的质量,并引入 5 个要害属性来评估。

药物发现数据的5V原则

在处置用于训练药物发现中的机械学习模子的数据时,需要思量5个属性。

药物发现数据的 5V界说如下:

1、准确的数据准确性:天生或可用数据的质量、完整性、准确性和一致性

2、准确的数据种类:数据的平衡水平若何?它涵盖什么动态局限?我们有哪些差异类型的数据可用?例如,对于卵白质来说,这可能意味着训练数据中的高序列或结构多样性。

3、准确的数据量:可用于训练模子的数据量

4、准确的数据速率:用于剖析目的的数据天生、积累和治理的速率有多快、成本有多低?这会影响我们验证或重新训练模子的容易水平

5、准确的数据价值:数据若何转化为临床效果(通常与生物庞大性相关)?

一样平常来说,数据准确性、多样性和数目是数据自己的品质,而速率有助于评估获取新数据的难易水平因此我们要使用什么流程和方式。

若是公共领域的数据很少,或者若是想使用基于自动学习的方式,那么后者尤其主要。数据的准确性基于生物庞大性及其与临床效果的相关性,这会影响数据读出的展望有用性。

数据真实性

使用生物学相关功效测定天生的一致、准确、高质量、符号的数据在药物发现的许多领域很少见,或者基本不存在。大型企业数据集通常没有用处,由于它们没有以一致的方式网络或数字化。同样,来自 CRO 的数据可能不包罗机械学习所需的 (ML) 相关控制和元数据。

若是公共数据已经存在,它通常包罗大量噪音、重复和错误,这需要仔细剖析、过滤、尺度化和其他预处置步骤才气使用。

好的数据应该是怎样的?AI药物发现数据的5V原则:来自差异流动尺度化前(左)和尺度化后(右)的基于细胞的测定中评估的两种差异对照分子的重复丈量数据。尺度化可以显着改变图像。

同样主要的是,与传统药物发现数据相比,机械学习级数据要求差异且加倍严酷。纵然丈量相同的化合物,差异实验室的读数也具有很大的可变性。这又是由于在差异条件下举行实验时会发生截然差其余效果。

好的数据应该是怎样的?AI药物发现数据的5V原则

图:与化学数据相比,生物数据面临的挑战

另外,公共数据还包罗大量错误,但大多数机械学习或化学/生物信息学论文(基本假设是输入数据的准确性。然而,数据库中的错误率可能很高。研究注释,平均每个药物化学出书物有两个错误,导致某些数据库中的总体错误率高达 8%,数据错误会显著降低任何模子的展望能力,而且在用于模子构建时需要稀奇小心。

好的数据应该是怎样的?AI药物发现数据的5V原则

图:在 ChEMBL 数据库中,研究了大规模自力细胞毒性丈量的可比性在自力实验室丈量的重叠复合细胞系系统中,可以考察到相关性较差。这部门是由于注释错误,指出了提取或积累公共数据时数据治理的主要性。

为了确保这种情形,应该破费大量的精神和资源来响应地确立实验室流程和数据处置管道,这反过来又能够确立真实的数据。

数据多样性

一样平常来说,这个方面指的是正数据和负数据的可用性,以及整个数据集跨越的局限。文献中用于形貌大型且多样化的聚集的通用术语是“代表性”。

“代表性”数据通常不存在,由于通常科学家选择不将所有化合物举行实验测试或抛弃失败的数据。无论是通过模拟、机械学习照样人类评估来确定优先级,通常的做法仍然是只生长具有*展望性能的分子,这意味着可能不会以最适合学习的方式选择数据。

所有这些限制都市极大地限制模子的学习能力。缺乏反例将限制展望显示不佳的化合物的能力,而缺乏动态局限将导致难以外推到感兴趣的区域并限制模子的适用局限。

数据多样性也可能导致更高的实验成本。例如,围绕特定支架合身分子通常比探索种种随机结构更容易。但序列/结构、物理化学和功效角度的多样性都可以推动模子做出更好的整体展望的能力。

除了某一指标的多样性之外,数据的“多样性”在种种剖析中也很主要。例如,丈量统一卵白质的活化、选择性、热稳固性、群集和产量对于推动项目向前生长至关主要。

为了对药物发现发生有意义的影响,我们需要领会多维优化空间,并在我们执行的剖析和捕捉的数据中拥有足够多的多样性。

数据量

固然,数目仍然很主要。若是质量合适,数据越多越好。训练机械学习模子所需的数据量可能差异很大。

例如,AlphaFold之以是乐成,部门缘故原由是它训练了 1971 年以来在 PDB 中网络的约 100,000 个卵白质结构的训练,而且数据清晰地涵盖了所有折叠(见 PDB 中的下图)。机械学习能够解决这个问题也就无独有偶了,由于问题空间已被周全笼罩。

好的数据应该是怎样的?AI药物发现数据的5V原则图 :2018 年 8 月 1 日添加到 PDB 的怪异折叠数目,使用 CATH 盘算。显示了每年怪异褶皱的总数(红色)以及每年添加的新褶皱(蓝色)。资料泉源:PDB

相比之下,展望较小局限的抗体序列的结构则更具挑战性。对于小型数据集,笼罩问题空间对照难题,传统的机械学习模子或包罗大量先验信息的专用模子通常更好。对于更大的数据集,基于神经网络/深度学习的方式越来越好用。

好的数据应该是怎样的?AI药物发现数据的5V原则图:PDB 中所有卵白质(蓝色)、抗体(红色)和黄色单域抗体(“VHH”)的晶体结构数目。资料泉源:PDB

数据速率

获取高质量数据的速率和成本对于天生大型数据集、使用自动学习和微调我们的模子至关主要。更容易丈量的生物学数据通常获取也更快,但数据价值也降低了。

在两者之间找到准确的权衡通常取决于生物手艺公司可以使用哪些方式以及他们若何有用地推进其项目。与临床终点高度相关的更高速率方式的创新可以在人工智能和机械学习时代带来基本优势。例如,自动学习需要快速的循环时间和足够高的吞吐量来完成设计-构建-测试-学习循环并快速迭代化合物。

数据价值

虽然我们可以控制数据的准确性、数目和多样性,但很难获得体内的庞大数据。已往,通过简朴的测定流程能够获得大量的数据,例如高通量亲和力筛选,但这些数据很少能够周全直观地反映药物在体内的显示。

因此,对优质数据的追求不仅包罗更多、更好质量的数据,还包罗对体内行为具有本质上更高展望性的新颖信息和数据。这也主要包罗几个方面。

情境化:有利于在尽可能最自然的环境中举行丈量的方式,或者更合理的是,在更类似于体内环境的环境中举行丈量的方式。例如,肿瘤微环境 (TME) 中的条件很难在 2D 甚至 3D 细胞培育物中重现。

功效性:直接评估流动而不是依赖退而求其次的方式。例如,抗体流动通常追求高亲和力连系物,但文献中的许多其他例子可以显著看出,较低的亲和力对于所需的功效(如激活或选择性)来说通常是足够的,甚至是必须的。

在这些情形下,更主要的是找到不仅是强连系剂而且具有选择性或具有其他治疗价值特征的化合物。亲和力驱动的选择性试图实现这一目的(参见此处HER2 的靠山)。

多尺度:整合差异数据模式来推断因果关系的方式,像TCGA这样的大规模设计提供了跨越临床、基因组、表达和成像模式的多样化数据网络的*示例。

转化:熟悉到其固有局限性并起劲将转化相关性作为设计目的的方式,无论是体内药物活性照样扩大的工业历程。庞大的体外模子正在逐步展示展望能力。也就是说,尚有很长的路要走,而且仍然存在许多悬而未决的问题。

5V框架总结

数据资源通常需要专家举行普遍的治理和预处置,提取有价值的数据,并削减错误和噪音。

小鹏「甜蜜的烦恼」:爆款G6难过交付关?

小鹏「甜蜜的烦恼」:爆款G6难过交付关?,从企业角度出发,它需要更多的订单,而消费者需要的则是,保证完美质量下的更快的交付。

更应该思量的是:天生有意义的数据,即与目的效果更相关的数据。

领会5V框架意味着人们可以努力地在成本和天生速率/数据可用性、数据质量和可翻译性之间取得平衡。还可以行使这个框架来评估我们的数据天生管道可以在那里改善,以*限度地提高数据的质量和效用。

若何获得优越的数据?

在对所需数据的属性有领会的基础上,重点最先关注若那边理数据,主要分为两个方面。

1. 机械学习驱动的药物发现的完整手艺栈

所谓手艺栈,是指某项事情或某个职位需要掌握的一系列技术组合的统称。

一样平常来说,我们需要区分用于训练程序内机械学习模子的数据(即仅用于特定程序的模子)和用于训练程序间机械学习模子的数据(纵然用的模子跨多个程序)。

对于程序间模子,数据的条件性通常会导致进一步的庞大性,由于程序和流程之间的差异使得数据尺度化变得加倍难题。例子包罗差其余顺应症或疾病特异性细胞系,或差其余测定条件。

程序内模子数据尺度化的步骤和要求大大简化,但在实践中仍需要大量事情。对于更庞大的生物学尤其云云。

下面的金字塔捕捉了组成药物发现中机械学习历程的完整栈。每一层都是必须的,任何一层中的错误或噪声都市降低机械学习数据剖析的最终性能。

好的数据应该是怎样的?AI药物发现数据的5V原则

图 :整个数据栈。较低层通常对药物发现设计的现实效果影响*。若是没有优越的基础(即展望剖析、数据天生、数据捕捉和数据预处置步骤),*的剖析也只能实现这么多。数据剖析和机械学习可以进一步细分为数据示意和机械学习模子。

在设计数据剖析或机械学习管道时,领会每一层并仔细评估噪声、错误和纷歧致的泉源异常主要。在评估手艺栈天生的数据时,主要的是要熟悉到在每一层所做的任何更改都需要手艺和科学团队之间的亲热相助。确定哪些层对数据质量影响*对于维护客栈的完整性至关主要,因此应延续举行评估。

下面列出了手艺客栈中的基本层,最终组成了一个完整的手艺栈:

    数据上下文和相关性:天生的数据的可用模子和上下文对于将天生的效果转化为有意义的(临床)效果异常主要。我们可以优化模子并捕捉分外的数据和元数据,以实验获取更多上下文。

    数据天生:通过使用尺度化流程、自动化和尺度化(装备等)可以天生一致的数据。营业规则、尺度操作程序和自动化是要害。

    数据捕捉和存储:应自动捕捉原始数据以及相关元数据,并凭证公正数据尺度以一致、平安的方式存储。理想情形下,公司中的任何人都可以立刻接见它。数据和模子的版本控制和泉源有助于确保准确的模子在准确的数据集上举行训练,并提高对错误和更改的恢复能力。

    数据处置:原始数据的处置需要在整个公司举行尺度化,并在适当的情形下举行尺度化(例如拟合曲线的 EC50 值)。自动化和营业规则可以削减此阶段的可变性。

    数据剖析和机械学习:只有当所有其他层就位后,才可以执行数据剖析和机械学习。这需要仔细的数据治理和模子验证。稀奇是特征选择、数据支解和相关性能指标的选择在这里施展着主要作用。

向数据驱动的生物手艺公司转型需要在职员、流程和系统方面举行战略转变。以下是在手艺方面的方式。

确立优越的药物发现手艺栈:

    流程尺度化:确立一致的流程,纪录在 SOP 和营业规则中,供整个组织使用。通过使用自动化和调剂来*限度地削减手动步骤。

    自动数据捕捉:开发管道和剧原本自动可靠地捕捉、跟踪和版本数据和元数据。选择可以与现有系统集成的仪器也很主要,现有系统通常需要合适的驱动程序。

    云和客栈接纳:行使 Google Cloud、AWS、Azure 等服务以及 Snowflake 和 BigQuery 等数据客栈来平安存储原始数据和处置后的数据。这使得能够立刻、全局地接见数据。

    实行模子和数据跟踪:使用 MLFlow、DVC 或 Google Vertex AI 管道等系统来跟踪模子、模子版本以及关联的数据和数据版本。

    跟踪和治理生物变异性:确立质量控制流程,例如自动跟踪要害测定指标和异常值检测。确立流程,通过执行数据尺度化来*限度地削减程序中的可变性。

    实验室自动化:使用自动化/机械人实验室*限度地提高流程一致性,并在更新系统时执行用户实验室/用户验收测试。

    用户友好的系统:确保系统易于实验团队导航并能够支持现代数据剖析方式。这可能需要连系定制和购置的解决方案。

    数据可接见性和交互:通过可视化和交互功效确保所有团队成员的数据可接见性,并实行天真的治理系统来治理用户权限。

总结一下:我们总是需要问自己一个问题:通过以较低精度展望庞大的特征或生物学,照样以较高精度展望更简朴的生物学,我们是否更有可能实现设计更好药物的目的?

一旦我们做出了这个因项目而异的决议,我们就可以以*方式优化整个手艺栈(包罗实验)的所有参数,以训练能够回覆有意义的生物学问题的模子。

2. 支持数据驱动方式的公司文化和团队组织

如前所述,公司文化和团队将在确立数据驱动型组织时施展要害作用。

企业文化:

    有远见的向导力:最高治理层应该说明成为数据驱动型组织的令人信服的愿景,并将这一愿景渗透到整个公司。这一愿景应该在各个层面上清晰一致地转达。例如,葛兰素史克(GSK)设立了高级副总裁兼人工智能和机械学习全球卖力人,许多生物手艺公司的团队中也设立了首席数据官。

    以数据为中央的奖励系统:实行奖励系统,激励数据质量、可接见性和数据驱动的创新,而不仅仅是短期里程碑。

    数据素养:通过确立定期培训设计和钻研会来优先思量数据素养。确保所有团队成员领会他们在数据价值链中的角色以及他们的孝顺若何影响组织的整体乐成。

    共享数据所有权:激励数据共享所有权的感受。为科学家提供易于接见的工具,让他们自己执行简朴的数据科学义务,并评估和更好地明晰他们天生的数据和数据的质量。这培育了自动数据治理的文化。

    关注端到端流程:促进对端到端数据流程的明晰,而不是只关注个体手艺。这有助于每小我私人熟悉到自己在更大靠山下的角色的主要性。

    配合责任和问责制:培育对短期和耐久功效配合卖力的文化。例如,机械学习在项目中的应用应该是数据科学家和湿实验室团队的配合责任。

    延续学习:致力于员工的延续教育。分配时间和资源用于新系统和手艺的延续培训。这延伸到了数据科学家和机械学习专家,他们需要深入领会湿实验室流程和天生的数据。

组织结构:

    跨职能团队:组建具有共享数据目的和责任的跨职能项目团队。这应该包罗数据科学家作为药物发现项目的焦点团队成员。

    统一地址:只要有可能,将团队放在统一地址以促进自觉的互动和协作。若是这不能行,请使用手艺来保持团队联系并促进频仍相同。

    尺度化流程:在整个公司的所有团队中强制使用尺度数据管道和系统。这种一致性有助于*限度地削减错误并促进更好的数据剖析。

    配合的乐成和失败:庆祝配合起劲的胜利,并让所有团队成员对任何瑕玷卖力。这种方式可以培育团结感和配合准许。

    知识共享:促进差异团队和靠山之间的知识共享。在定期聚会中注释手艺并相同需求,并在整个企业中随时提供资源和信息。项目团队应保留所有决议和步骤的清晰文档,包罗所使用的模子和数据。

    产物团队:(即构建盘算事情流程或剖析系统的任何团队)需要由科学或用户主导,但软件开发职员或数据科学家需要成为焦点产物团队的一部门。配合界说产物规范并执行用户验收测试是构建有用工具的要害。

参考链接:

https://medium.com/@leowossnig/the-right-data-for-good-results-introducing-the-5-vs-of-drug-discovery-data-331e29c683c5

【本文由投资界相助同伴微信民众号:智药局授权公布,本平台仅提供信息存储服务。】若有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处置。

原创文章,作者:APP软件开发,如若转载,请注明出处:https://www.yuanma666.com/archives/59222.html

(0)
APP软件开发APP软件开发
上一篇 2023年8月14日
下一篇 2023年8月14日