2022年4月1日 星期五

KNN Networks

今天p 討論了single cell analysis為什麼要用knn?

knn的目的應該是要降噪,就是SC 的gene count有太noise,有一些細胞有,有一些細胞沒有,就算是同一類的細胞,結果就是用knn或snn來降低noise, 把附近相似的細胞都放進考慮。優點是noise降低,但解析度也變差,細胞間的差異被模糊化,這樣一來,真正的少數細胞就有可能看不到了。

究竟是真的沒有讀值?還是噪音呢? 這是不是現有single cell的最大限制呢?

而network的建立,目的除了降噪,還可以用在非監督的分群上,在沒有真實(GROUNDTRUTH)的情況下,分類問題就只能用非監督的方法了。像是單細胞的分類,沒有人知道一群未知內確實的情況。另一個不知是不是類似的例子是cfDNA,在mapping某人的cfDNA結果後,怎麼做一個整体的評估?這種情況有沒有label?會是一個machine learning的問題?

ML的強項是預測,但是SCA的大目標是發現新的population,這二點在使用nn上有一點衝突,本來降噪就會讓不同的個体的特別性消失,除非個体的數量有一定比例,或可自成一群。這也許會有讓enrich的技術有提高價值得出路。

另外,有沒有什麼辦法可以比較非監督的clustering結果? 或有什麼機會把ml的預測異常整合一起?

沒有留言:

張貼留言