ERPC 大幅升級 Solana 網路基礎設施,全面更新 Rust 高效能代理平台並部署至所有區域的共享 RPC、gRPC 與 Shredstream,達成零停機更新

由 ELSOUL LABO B.V.(總部:荷蘭阿姆斯特丹,CEO:Fumitake Kawasaki)與 Validators DAO 營運的 ERPC,完成了對其 Solana 網路基礎設施的重大升級。
此次升級已套用至 ERPC 提供的所有區域與共享端點(Solana RPC、Geyser gRPC 和 Shredstream)。我們將連線初始化、TLS 處理、快取控制、HTTP/1.1 與 HTTP/2 傳輸、長連線行為,以及可觀測性和故障診斷指標等經常直接影響實際營運結果的基礎設施行為,視為一套完整系統進行更新。
在維持日常回應性的基礎上,我們還重新組織了底層網路行為,使其在容易導致結果退化的情境中——如峰值負載波動、持續營運下的不穩定性,以及斷線和重新連線觸發的級聯——更不容易產生偏差或不穩定。因此,該環境現在更有利於在實際 Solana 營運中同時維持效能和穩定性。
此外,我們已轉換到能以完全零停機方式套用網路設定變更和平台升級的營運架構。定價、設定、認證或速率限制均未變更,現有 ERPC 客戶不需額外設定或改變營運方式,即可取得本次升級的效益。
背景
在實際的 Solana 營運中,平均回應時間和正常時段延遲是關鍵的基線要求。同時,存在一些底層網路基礎設施行為本身決定結果的情境——如負載集中時、長連線執行期間,以及斷線與重新連線期間。
共享端點尤其需要同時因應短時間內突增的交易提交,以及透過 WebSocket 與 gRPC 維持的持續連線。在這些條件下,基礎設施層面的行為——連線初始化、TLS 握手、傳輸行為、快取處理和從空閒狀態恢復——直接影響使用者體驗和執行結果。
即便以平均回應速度為明確基線,峰值或持續執行期間的實際結果仍可能由其他因素決定。因此,實際維運既要確保日常可用性,也要維持容易發生故障之情境中的連續性。
ERPC 設計並營運自己的 Rust 高效能代理平台作為 Solana 通訊的基礎,維持在所有區域應用相同方法的架構,同時持續演進平台。此次升級將營運中觀測到的問題作為統一系統重新審視——從連線初始化到長時間執行——並相應地重新組織整個網路基礎。
ERPC 客戶有何變化
透過此次更新,ERPC 客戶首先會看到連線建立初期更加穩定。建立連線並完成 TLS 處理時,狀態不相符與不必要的重試都會減少,使交易和資料流更容易從一開始就可靠進入處理。
其次,我們重構尖峰負載期間容易引發波動的基礎設施行為。透過及早過濾無用連線,並同步改進 HTTP/1.1 與 HTTP/2 傳輸、逾時一致性、連線池健康度、資源競爭時的快取行為,以及可觀測性與故障診斷指標,即使負載集中,處理也更不容易失衡。
對於長連線的 WebSocket 和 gRPC 流以及持續監控工作負載,連線連續性得到了改善。斷線/重新連線/重新同步事件的頻率——以及這些事件級聯影響結果的可能性——已降低,使圍繞持續執行來設計維運變得更加容易。
快取控制和傳輸行為的改進,也減少了壅塞期間重複拉取和無效處理。頻寬與處理餘量能夠更穩定地保持可用,擴大後的指標和可觀測能力則有助於縮短根因定位與恢復時間。
此外,透過零停機套用設定變更和平台升級,我們建立了能高頻率提升效能、穩定性和整體平台品質的營運條件。不需暫停平台即可持續改進,進一步保障客戶營運的連續性。
改進詳情
此次升級並不以特定功能名稱或版本號作為發布主線。相反,它把往往主導實際 Solana 結果的情境拆分到以下層面——連線初始化、TLS、L4/HTTP 邊界、H1/H2 傳輸、快取、可觀測性、故障行為和長期營運先決條件——並更新平台,使這些層能夠彼此一致地協同工作。
下面,我們從對客戶體驗和營運結果的貢獻角度解釋所納入的改進。
連線初始化和 TLS 處理的改進
我們擴充連線建立期間處理的 TLS 連線脈絡,並更新結構,確保所需狀態能妥善保留和套用。這減少連線建立初期的狀態不一致與不必要重試。
我們也重構 TLS 處理,包括憑證驗證與主機名稱驗證;在符合安全要求的同時,減少握手失敗或處理不一致造成的初始損耗,避免進一步影響結果。這不只是安全性強化,也有助於穩定從建立連線到進入 Solana 工作負載處理的整段行為。
我們進一步強化 TLS 相關行為的可觀測性與問題診斷機制。在初始化主導結果的情境中,重現問題、找出原因並快速完成修復,是維持體驗品質的核心能力。
透過早期過濾不必要連線來保持餘量
我們引入早期過濾 TCP 連線的機制,減少異常或不必要的連線對正常流量造成壓力。在共享端點中,連線請求可能因外部因素或暫時性偏差而激增。
早期過濾可減少正常連線在建立階段停滯的情況,並讓峰值負載期間的處理餘量更容易保持可用。因此,即使負載集中,處理也更不容易失衡,延遲分布會更加穩定。
透過重新組織 L4/HTTP 邊界來明確連線模型
網路基礎設施不止於 HTTP。連線建立與連續性取決於 L4 條件,該層的波動會影響更高層通訊協定的使用體驗。
在此次更新中,我們抽象了 L4 流處理並重新組織了結構,以更清晰的方式管理連線模型。如此一來,即使連線數持續增加、用戶端實作各異,或長時間執行導致狀態轉換,平台也更容易維持一致行為。
重試行為也被重新組織,以減少短期波動級聯到使用者體驗的模式。實際穩定性更多取決於防止故障級聯,而非消除孤立故障。
HTTP/1.1 和 HTTP/2 傳輸及長時間執行行為的改進
我們增加可跨 HTTP/1.1 與 HTTP/2 一致追蹤傳輸資料量的偵測指標,讓傳輸管道中的停滯或瓶頸更容易被識別,也加快故障診斷與修復。
我們也重構 HTTP/2 body-write 逾時行為,減少集中負載或長時間資料流期間的異常停頓與卡住。在長時間執行中,重要的不是理想狀態下的峰值效能,而是在狀態轉換期間防止行為崩潰的能力。
閒置逾時行為和連線池處理也已完成檢視,消除持續執行過程中容易累積的不穩定因素。在 HTTP/1.1 方面,我們重新整理安全關閉持有不完整請求之連線的方式,減少資源使用和行為上的波動來源。
快取控制和營運品質的改進
我們增強了追蹤資產為何未被快取的能力,提升了快取行為的可解釋性。在實務上,主導因素不是有沒有快取,而是快取會在什麼條件下套用、又會在什麼條件下失效。
我們重構鎖定行為、過期內容處理和重新驗證模式,避免尖峰負載下的資源競爭引發連鎖體驗劣化。我們也改善快取物件增多時的汰除控制,並最佳化包括 Range 請求在內的部分內容處理,進一步減少實際工作負載中的重複擷取與延遲。
這些改進減少了快取行為出現異常偏差的情況,使客戶不太可能需要圍繞基礎設施層面的不確定性來設計營運。
故障行為、日誌和可觀測性的改進
故障行為和日誌已重新整理,讓問題發生時更容易掌握實際情況。下游錯誤連鎖影響快取或傳輸行為、進而惡化體驗的情況已減少,也更容易界定故障影響範圍。
改進可觀測性與故障診斷,並不是為了宣稱「零事件」,而是要在事件發生時縮短恢復時間,降低尖峰負載與持續營運情境中的風險。
相依套件更新和安全修復是長期營運的先決條件
我們納入相依套件更新與安全修復,以維持平台長期營運的先決條件。其中包括對齊最低支援 Rust 版本(MSRV)和 CI 的相關更新,強化平台持續演進所需的基礎。
能夠安全地持續更新,本身就是長期品質的要求。
向零停機營運的過渡
過去,網路設定變更或平台升級期間可能出現短暫停機。透過此次更新,我們已改用能在完全零停機下套用這些變更的架構。
共享端點同時承載長期連線與對時序敏感的操作。即使短暫停機,也可能觸發斷線、重新連線和重新同步的連鎖反應,相關成本還會進一步影響結果。零停機更新降低這類連鎖反應的發生機率,避免長時間執行的營運被打斷。
同時,ERPC 現已具備把觀測到的問題快速轉化為改進的維運能力。提高迭代頻率後,我們便能在正式營運中持續消除波動與邊緣情境中的異常行為。
各服務受到的影響
Solana RPC(HTTP / WebSocket)
連線初始化、TLS、快取控制和傳輸行為的改進影響資料讀取和交易提交兩方面。在維持日常可用性的同時,減少了在峰值負載期間使結果產生偏差的因素,加強了在壅塞期間保持餘量的條件。
Geyser gRPC
長時間資料流的連線連續性獲得改善。HTTP/2 傳輸、逾時一致性、連線池健康度和擴充後的傳輸測量協同運作,降低重新連線與重新同步的成本影響最終結果的可能性。
Shredstream(Direct Shreds)
透過針對持續交付改進連線管理和初始化,系統更有能力在壅塞期間避免資料缺失或延遲,也更容易維持偵測與後續處理的連續穩定。
串聯研發與正式營運
包括 ERPC 在內的分散式系統平台,已被認定為荷蘭政府 WBSO 計畫下的研發專案,並建立一套機制:將維運中觀測到的問題納入研究課題,再透過驗證與迭代加以改進。
此次網路基礎更新正是這類迭代之一,已套用至所有區域,並轉化為實際的效能與穩定性提升。讓維運與研發保持聯動,是把正式環境中觀測到的問題持續帶入下一次更新、而非止步於一次性改進的前提。
在 ERPC 內部,實際使用模式、負載波動與故障模式都會納入反覆驗證與改進的週期,逐步提升網路基礎品質。此次更新是在研發與正式營運的整合框架內執行的。
客戶資訊
本次更新已套用到所有區域與所有共享端點。現有 ERPC 客戶不需變更設定或營運方式。定價、設定、認證和速率限制均未改變。
由於共享端點必須同時承受短暫的峰值和長連線,架構已相應重構,使處理在這些混合工作負載下更不容易失衡。即使在營運期間發生設定變更或平台更新,變更也會以零停機方式應用,因此客戶無需預先為連線中斷或重新同步制定應對方案。
有關架構、特定工作負載最佳化或營運回饋的問題,請透過 Validators DAO 官方 Discord 聯絡。
透過把正式環境中的觀測與回饋持續轉化為改進,ERPC 已逐步提升基礎品質。我們將在零停機的前提下繼續推動改進,提供能維持實際 Solana 營運成果的網路基礎設施。
Validators DAO 官方 Discord:https://discord.gg/C7ZQSrCkYR
ERPC 官方網站:https://erpc.global/zh-tw


