詳解
傳統 async 的局限性
你可能會注意到
,而且扔到 asp.net core 裏跑發現 RPS 居然不升反降,一旦大量代碼具有這種要求
,從而進一步導致 JIT 看不到整個異步調用鏈,Green Thread 和硬件安全機製也有衝突
。而是直接返回 T的值。當然這是內部表示 ,它負責把 Runtime Async 內部的普通返回值 + Continuation 轉換成外部調用方所期待的 Task<int>。
首先 async/await 模型下
,JIT 實際上會生成一個采用 Async Calling Convention 的內部版本 Program:Fib(int):int:this
,其實是不知道一個異步調用到底會不會真正暫停的。直到 Task.Delay完成 ,
上述問題在暫停真正發生的情況下其實並不是什麽太大的問題 ,裏麵存儲了保存的異步狀態。
另外,
然而這種方案有天然的缺陷 :
Green Thread 再輕量其本質上仍然是一個完整的執行上下文 ,甚至需要操作係統提供專門的支持。OS 以及各種依賴 thread-local 的代碼 。也沒有任何狀態機的開銷 ,
以下是一個簡單的示例 :
public async Task<int> GetDataAsync(){ // 模擬異步操作 await Task.Delay(1000); return 42;}上麵這個例子中,返回值走寄存器
,因此哪怕 JIT 想要做一些跨方法的優化也很難做到。await關鍵字會暫停 GetDataAsync方法的執行,因此運行時不僅需要切換普通棧指針,Green Thread 需要運行時在用戶態實現線程調度
,於是實際上等價為
:
var result1 = Fib(n - 1);var result2 = Fib(n - 2);return result1 + result2;你會發現,下麵會解釋
。說明調用已經同步完成
,因此也確實需要一個 Task對象來存儲結果。Runtime Async 也有顯著的性能提升,為什麽上麵明明有 Program:Fib(int):int:this,最簡單的辦法就是將異步方法拆分成多個部分,返回值和 Continuation 都可以被放進寄存器裏。並通過 MoveNext 、因此 ,但在整個異步調用鏈中,那解決這個問題的辦法非常簡單,
例如第一次遞歸調用:
await Fib(n - 1)被編譯成:
lea edx, [rbx-0x01] ; n - 1mov rdi, r14 ; thisxor rsi, rsi ; Continuation = nullcall [Program:Fib(int):int:this]而 Fib(n - 1)實際上返回了兩個值:
eax = Fib 的 int 返回值rcx = Continuation當然,對比 .NET 10 的傳統 async(Async1)。從原來的約 300 ms 增加到約 1800 ms,它不再讓 C# 編譯器提前把 async 方法展開成狀態機 ,就知道整個異步調用鏈已經暫停了,Task
、性能提升了近 20 倍,同樣采用了 async/await 模型
,既然 C# 編譯器無法判斷 ,MoveNext方法通常非常大,並將 Runtime Async 方法按照一種特殊的 async calling convention 編譯
。整個調用鏈中根本沒有創建任何 Task對象
,一個普通的方法調用類似於:
result = B(args);而在 Runtime Async 中,那麽這個 Task<T>對象就根本不會被創建,正常返回值和額外的 Continuation 都屬於調用約定的一部分,而且這樣一來 ,
於是調用方隻需要 :
mov r12d, eaxtest rcx, rcx ; Continuation 是否為 nulljne SUSPEND ; 如果不為 null,那你說,但有這 2KB 都夠創建幾百個 async 狀態機了
。如果沒有真正發生暫停,從而進一步提高性能。由於 Green Thread 並不是操作係統線程,隨後再根據需要動態擴張,同時額外增加一條用於傳遞 Continuation 的通道。但它也有一些局限性。
運行後,並且調用鏈越深性能提升還會越大!保存這這些東西隻需要幾十個字節,考慮下麵這個遞歸計算斐波那契數列的異步方法
:
class Program{ async Task<int> Fib(int n) { if (n <= 1) return n; return await Fib(n - 1) + await Fib(n - 2); }}
我們編譯出程序集後讓 ILSpy 反編譯 IL 得到
:
internal class Program{ [MethodImpl(MethodImplOptions.Async)] [NullableContext(1)] public Task<int> Fib(int n) { //IL_0026: Expected O, but got I4 //IL_0006: Expected O, but got I4 if (n > 1) { int num = AsyncHelpers.Await(Fib(n - 1)); int num2 = AsyncHelpers.Await(Fib(n - 2)); return (Task<int>)(num + num2); } return (Task<int>)n; }}
除了原始邏輯之外什麽狀態機都沒有!預熱之後各個測試運行一億次
,
在 x64 上
,比如 GUI 應用中消息循環可能會以每秒上萬次的頻率調用線程親和的 API ,甚至還可以在整個異步調用鏈中進行內聯, add ebx, r12d mov eax, ebx ; return value xor ecx, ecx ; null Continuation retSUSPEND_FIRST: ; Fib(n - 1) 暫停了,運行時還需要處理 Green Thread 與係統線程之間的切換
、C# 編譯器在變換異步方法的時候
,Continuation非空的情況也能直接從生成代碼中看到。async 關鍵字其實並不是必須的
,
等到被等待的異步操作完成以後,
而在發生暫停的情況下 ,幾乎完全消除了傳統 async 的開銷,
還有 ,因此在涉及係統調用時 ,等待一個 TaskCompletionSource 導致的暫停
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);if (continuation2 != null) Suspend(continuation2);return result1 + result2;而實際上 ,但 C# 編譯器已經提前把這種高層異步語義拆散了,當異步操作完成時 ,Task.Delay(1000)是一個異步操作
,這個調用約定會使用 MethodImplOptions.Async來標記,在所有測試中,運行時會再次進入這個 Runtime Async 方法,實際的 C# 並不會直接操作 Task ,例如 goroutine 的用戶棧初始大小大約就是 2 KB
,這個 Task<int> 會在當前異步方法完成時被設置為完成狀態。通過把返回值類型改成值類型並通過 IValueTaskSource來實現異步操作的複用 ,C# 編譯器會把異步方法改寫成狀態機,
這樣一來,JIT 在編譯 MoveNext時通常會因為代碼體積過大而避免內聯,這個方法通過寄存器傳遞參數(this 指針、於是誕生了諸如 ValueTask這樣的優化方案 ,而是一個用來標記暫停點的關鍵字
。而真正暫停時也隻需要為實際使用的狀態付費
。調用約定會變成:
(result, continuation) = B(continuation, args);這裏的 continuation 用來表示整個異步調用鏈在發生暫停後繼續執行所需要的狀態。無法在編譯 GetDataAsync的時候看到 GetValueAsync的具體實現
。調度行為和運行時高度耦合 ,
然而事實證明其實很多異步方法根本不會暫停,
Task<int>了。例如在一個異步方法裏調用了一個同步方法,雖然很長但姑且先貼在這裏
,當前需要從哪個暫停點恢複、由於 JIT 能夠直接看到完整的異步調用控製流,等待一個嵌套了多層的異步調用鏈,但沒有發生暫停 。除此之外,結果如下 :


測試結果原始數據如下:
| Benchmark | Ops | Async1 Time/op | Async2 Time/op | Ratio | Async1 Throughput | Async2 Throughput | Async1 Total Alloc | Async2 Total Alloc | Async1 Bytes/op | Async2 Bytes/op | Async1 Gen0 | Async2 Gen0 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Synchronous baseline | 100.0M | 0.33 ns | 0.33 ns | 1.00× | 3.008B ops/s | 3.004B ops/s | 696 B | 696 B | 0 | 0 | 0 | 0 |
| Async method, no suspension | 100.0M | 6.58 ns | 0.34 ns | 19.63× | 152.0M ops/s | 2.984B ops/s | 7.20 GB | 696 B | 72.0000 | 0 | 459 | 0 |
| Completed Task await | 100.0M | 4.01 ns | 0.33 ns | 12.02× | 249.1M ops/s | 2.995B ops/s | 7.20 GB | 696 B | 72.0000 | 0 | 459 | 0 |
| Completed ValueTask await | 100.0M | 0.75 ns | 0.33 ns | 2.25× | 1.329B ops/s | 2.987B ops/s | 696 B | 696 B | 0 | 0 | 0 | 0 |
| Task.Yield suspension | 100.0M | 242.89 ns | 34.68 ns | 7.00× | 4.12M ops/s | 28.84M ops/s | 992 B | 1,000 B | 0 | 0 | 0 | 0 |
| ThreadPool continuation | 100.0M | 324.78 ns | 102.35 ns | 3.17× | 3.08M ops/s | 9.77M ops/s | 16.00 GB | 15.20 GB | 160.0000 | 152.0000 | 1,027 | 969 |
| TaskCompletionSource continuation | 100.0M | 455.50 ns | 114.16 ns | 3.99× | 2.20M ops/s | 8.76M ops/s | 16.00 GB | 16.00 GB | 160.0001 | 160.0000 | 1,027 | 1,021 |
| Async state-machine chain | 100.0M | 678.33 ns | 91.68 ns | 7.40× | 1.47M ops/s | 10.91M ops/s | 30.10 GB | 19.20 GB | 300.9802 | 192.0000 | 1,927 | 1,226 |
結果簡直令人震驚 !
這一套機製也真正實現了 pay for play:不暫停就不為異步抽象付費
,說明被調用的 Fib沒有同步完成。調用方在收到非空的 Continuation 後,Runtime Async 保留普通返回值原本的 ABI,
最終,Fib 的簽名仍然是 Task<int> Fib(int) 。調用鏈更深的 Async state-machine chain 的性能更是提升了 7.4 倍,調用棧以及運行時調度所需的各種元數據
。異步方法的返回值是一個 Task或 Task<T>,類似的原因 ,它隻需要保存非常少量的東西,此時 eax中就是有效的返回值,
另外 ,並返回一個非空的 Continuation 對象給調用方,真正的係統調用最終仍然需要由底層承載它的係統線程來執行 。如果失敗則會在這裏拋出異常 。這個邊界就是 async thunk。將當前異步方法拆分成多個部分,
如果 rcx == null,
首先,例如 Intel CET Shadow Stack 會由硬件維護一份受保護的返回地址棧,測試代碼見:https://gist.github.com/hez2010/d1802e7c7ab10e21a92dcba2afe0a58d 。輪到 JIT 編譯器這個方法的時候總該能判斷了吧 ?
其實也不行 。這破壞了 JIT 對整個異步調用鏈的優化能力 。整個調用鏈就像普通的同步函數調用一樣執行 。用戶並不能直接使用。而上層的異步方法隻是簡單地把結果傳遞下去 。Runtime Async 直接把內存分配和 GC 全都降到了 0 ,
Program:Fib(int):int:this ; await Fib(n - 1) lea edx, [rbx-0x01] ; n - 1 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov r12d, eax ; result1 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_FIRST ; await Fib(n - 2) lea edx, [rbx-0x02] ; n - 2 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov ebx, eax ; result2 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_SECOND ; 兩個調用都同步完成的情況,相較於 Green Thread,例如在 C++ 中,並且 JIT 能證明這個 Task 不會逃逸
,總結
Runtime Async 是 .NET 11 引入的一套全新的異步執行機製。額外的 Continuation 也走寄存器,於是這部分的開銷直接歸零
。C# 之所以要求 async 關鍵字,等待一個 ThreadPool 上的 continuation 導致的暫停
Task<int>方法
,而這個同步方法又調用了另一個異步方法
,於是程序可以立即繼續執行:lea edx, [rbx-0x02]mov rdi, r14xor rsi, rsicall [Program:Fib(int):int:this] ; 進行第二次遞歸調用 Fib(n - 2)換成接近 C# 的偽代碼 ,會觸發此前注冊的 continuation , // 這樣調用方在 await GetDataAsync() 時就能接收到異常並進行處理。C# 編譯器什麽都不做,等待一個已經完成的 Task
.NET 官方在實現完 Green Thread 後發現這玩意不僅局限性很大,
也就是說 ,並且由於被暫停的代碼是在之後才被恢複執行的 ,JIT 很難再把它重新恢複出來。線程親和性也是一個問題。因此 Runtime Async 的開銷遠小於 Green Thread。ThreadPool continuation 和 TaskCompletionSource continuation 的性能提升了 3~4 倍 。
Green Thread
其實在本文即將重點介紹的 Runtime Async 之前 ,使狀態機再次執行 MoveNext。等待異步操作完成後繼續執行:
class StateMachine{ private int state = 0; // 創建一個用來存儲結果的 Task<int>
,最後 ,被等待的異步操作尚未完成,async/await 模型下 ,
這麽一來
,整條調用鏈的數據傳遞形式可以說跟普通同步函數調用沒區別:參數走寄存器,說明發生了暫停
就可以同時獲得異步方法的返回結果 ,
性能測試
接下來我們來看看 Runtime Async 的性能表現。其實隻是要讓編譯器知道在這個方法裏,直接調用普通方法
當第一次調用異步方法時 ,.NET 的 Green Thread 實驗中發現 Green Thread 上做係統調用 1 億次,
Runtime Async 給 .NET 運行時引入了一套全新的調用約定:Async Calling Convention 。 mov rdi, rcx mov rsi, 0x... ; Continuation type call [CORINFO_HELP_ALLOC_CONTINUATION] mov r15, rax mov dword ptr [r15+0x4C], r12d ; 保存 Fib(n - 1) 的結果 ; ... 保存其他需要保存的狀態 ... mov rcx, r15 ; return Continuation ret; --------------------------------------------Program:Fib(int):Task<int>:this mov rdi, rbx ; this mov edx, r15d ; n xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] ; 調用真正的 Runtime Async 方法 mov ebx, eax ; result test rcx, rcx ; Continuation == null? jne THUNK_SUSPENDED ; return Task.FromResult(ebx) mov rax, <Task<int>> retTHUNK_SUSPENDED: ; var task = new RuntimeAsyncTask<int>(); ; 把 continuation 連接到 task; ; return task;
可以看到對於這個方法,執行速度跟同步方法的基線幾乎沒有差別。這樣的調用鏈實際上是同步的。 FailTask(ResultTask, ex); } }}
這麽一來 ,這會使很多原本可以跨方法進行的優化變得非常困難 。並判斷這次調用是否發生了暫停。還必須正確維護與底層係統線程相關的 Shadow Stack 狀態 。當異步調用沒有真正發生暫停時,並在函數返回時檢查普通調用棧中的返回地址是否與 Shadow Stack 一致。每個部分在 await 處暫停,於是宣布放棄 Green Thread 的實驗 ,等待一個 Task.Yield 導致的暫停
Continuation為 null。但實際上大部分負載都是同步的
。其次,
這個測試包含了各種不同的場景 :
- Synchronous baseline:同步基準測試,如果整個方法執行過程中都沒有真正發生暫停,例如:
public async Task<int> GetDataAsync(){ return await GetValueAsync();}public async Task<int> GetValueAsync(){ return 42;}C# 編譯器會為兩個方法都生成狀態機和
Task<int>,並且需要在被等待的異步操作完成後繼續執行 。而是把異步控製流保留到運行時 ,很多異步方法可能根本不會暫停 ,等待一個已經完成的 ValueTask - Task.Yield suspension
:異步方法
,這套調用約定會在在普通的方法調用約定之外,JIT 看到的已經不是
A -- await B -- await C這樣直接的異步調用鏈,.NET 還實驗過 Green Thread 的方案,這在高性能場景下可能會帶來額外的內存分配。把原始的異步控製流直接交給 JIT 處理不就行了嗎 ?於是 Runtime Async 就誕生了 。 state = 1; // 注冊 continuation 。所有的異步抽象開銷全部消失了!這樣一來 ,async/await 機製本質上是利用 CPS(Continuation Passing Style)變換來實現的。並在被 await 的異步操作完成後繼續執行剩餘的代碼。最裏層由 Task.Yield 導致暫停
測試目前最新的 .NET 11 每日構建版本的 Runtime Async(Async2) ,這套機製允許開發者以同步方式編寫異步代碼,
傳統 async/await
.NET 自古以來就提供了 async/await 異步編程模型,甚至比直接使用係統線程還要慢 。於是 GetDataAsync方法實際上就會被編譯成 :
public Task<int> GetDataAsync(){ var stateMachine = new StateMachine(); stateMachine.MoveNext(); return stateMachine.ResultTask;}上麵的 CreateIncompleteTask和 CompleteTask隻是為了說明原理而使用的偽代碼。於是我們必須創建一個 Continuation 來保存當前的執行狀態。轉而開發 Runtime Async。例如部分 GUI、
不過相信你會發現,但 C++ 並不要求 async 關鍵字 。用戶編寫的代碼仍然是原來的 async/await 形式 :
async Task<int> A(){ return await B();}在傳統 async 中 ,因此如果代碼真正暫停了, CompleteTask(ResultTask, 42); return; } } } catch (Exception ex) { // 如果在 MoveNext 中拋出了異常,
另外 ,
例子
接下來讓我們看看 Runtime Async 會生成什麽樣的代碼。每個狀態對應著 await 關鍵字的邊界 。因此至少需要保存寄存器狀態、當然 ,
例如 ,沿著 Async Calling Convention 返回給上一層。尤其是在沒有發生暫停的情況下 ,被標記的方法則會作為 CPS 變換的入口點。例如跨越暫停點後仍然存活的局部變量 、然後繼續執行返回值為 42 的代碼
。卻同時還有 Program:Fib(int):System.Threading.Tasks.Task`1[int]:this呢?這是因為 Runtime Async 內部的方法調用采用新的 Async Calling Convention ,並不需要為每一層 async 調用創建額外的結果包裝對象 , // 當 Task.Delay 完成後,掛起與恢複等額外工作 ,那到運行時,此時運行時會保存繼續執行所需要的狀態
,方法就像普通同步方法一樣從頭開始執行。但從普通 C# 代碼看來
,雖然你的方法返回的是 Task<T>

