跳至內容

什麼是物件儲存?

物件儲存

物件儲存是一種資料儲存架構,它將資料作為離散物件進行管理,而不是像傳統方式那樣以層級結構中的檔案或儲存磁碟區上的固定大小區塊進行管理。每個物件都包含資料本身、描述性元資料和一個唯一標識符,從而實現高效的儲存、檢索和迭代。管理功能 跨分散式環境。

與專為結構化工作負載設計的傳統儲存系統不同,物件儲存架構專為可擴展性、持久性和豐富的元資料而建置。它常用於雲端環境、超大規模資料中心和人工智慧( AI ) 基礎設施,這些環境中的資料集規模可達 PB 級甚至 EB 級。其架構消除了分層檔案系統的限制,從而實現了近乎無限的可擴展性。

物件儲存是現代基礎設施的基礎。它支援備份和歸檔系統、雲端原生應用程序, AI 訓練管道、媒體庫和大規模分析平台。隨著企業產生越來越多的非結構化數據,物件儲存已成為旨在實現長期成長和營運效率的分散式儲存策略的核心組成部分。

物件儲存的工作原理

物件儲存架構將資訊組織成稱為「物件」的離散單元,並將其儲存在分散式儲存系統中。與將資料放入資料夾或分割成固定大小的資料區塊不同,物件儲存系統將每個物件儲存在扁平的位址空間中,並使用唯一識別碼進行檢索。這種設計實現了跨多個儲存節點和地理區域的水平擴展。

每個儲存物件都由三個核心元件構成:

數據

資料指的是實際儲存的內容。這可能包括非結構化訊息,例如:

  • 文件
  • 圖片和影片文件
  • 備份存檔
  • 紀錄檔案
  • AI 訓練資料集
  • 應用程式數據

物件儲存針對大量非結構化資料進行了最佳化,使其非常適合雲端、媒體、分析和AI工作負載

元數據

元資料描述儲存的物件。與僅維護檔案大小或時間戳記等有限屬性的傳統檔案系統不同,物件儲存支援廣泛且可自訂的元資料。

元資料可能包括:

  • 建立和修改時間戳
  • 所有權和存取控制
  • 應用特定標籤
  • 法規符合性 分類
  • 內容描述符

豐富的元資料支援跨分散式儲存環境的進階索引、搜尋、自動化、生命週期策略和智慧資料管理功能

唯一識別符

每個物件都被指派一個全域唯一識別碼 (GUID)。該標識符取代了傳統的檔案路徑,並允許透過 API 直接存取物件。

唯一識別碼:

  • 在扁平命名空間中尋找對象
  • 無需遍歷目錄即可實現可擴展的檢索
  • 支援跨多個節點或區域的分散式存儲
  • 簡化對 S3 相容儲存系統的資料存取

物件儲存系統中的每個物件都是自包含的,它將資料、豐富的元資料和全域唯一識別碼組合成一個可尋址的單元。

扁平命名空間與分層檔案系統

傳統檔案儲存系統採用目錄和子目錄的層級結構。每個文件都是透過在該樹狀結構中導航來查找的。隨著資料量的成長,管理和擴展這種層級系統變得越來越複雜。

物件儲存採用扁平命名空間。物件並非儲存在系統層級的嵌套資料夾中,而是存在於同一個邏輯池中,並透過其唯一識別碼直接存取。雖然使用者介面可能為了方便起見而模擬資料夾結構,但底層架構仍然是扁平的。

這種扁平化設計具有以下特點:

  • 幾乎無限的可擴展性
  • 簡化的分散式存儲管理功能
  • 大規模高效資料檢索
  • 提高橫向擴充儲存環境的彈性

透過消除結構性瓶頸,物件儲存架構能夠滿足雲端服務供應商、超大規模營運商以及資料中心營運商的大規模成長需求。 AI以……為主導的企業。

物件儲存、區塊儲存和檔案存儲

企業儲存架構通常分為三種主要模型—物件儲存、區塊儲存和檔案儲存。每種模型都服務於不同的工作負載需求和基礎架構設計。在為雲端設計橫向擴展儲存環境時,了解它們的結構差異至關重要。 AI或資料庫應用程式。

特徵

物件儲存

區塊儲存

文件儲存

結構

扁平命名空間

原始儲存塊

分層檔案系統

可擴展性

極高

緩和

緩和

元數據

功能豐富且可自訂

極簡主義

有限的

常見用例

雲端平台、備份、 AI 資料、內容儲存庫

資料庫、事務系統

共享檔案系統、使用者目錄

結構差異

物件儲存將資料儲存在單一邏輯池中,並透過物件標識符進行訪問,從而消除了傳統的目錄層次結構限制,並實現了跨分散式節點的水平擴展。 

區塊儲存將資料分割成固定大小的區塊,這些區塊由作業系統管理。它具有低延遲,並針對資料庫等事務性工作負載進行了最佳化,但擴充通常需要更複雜的儲存方案。管理功能。

檔案儲存以資料夾和子資料夾構成的分層目錄結構組織資料。它常用於共享檔案系統和網路附加儲存環境,但在容量非常大的情況下,高效擴展會變得更加困難。

可擴充性和元數據

物件儲存架構專為大規模應用而設計,支援跨地理分散式系統的數十億個物件。其強大的元資料功能使企業能夠大規模地標記、分類、自動化和管理資料。

區塊儲存提供的元資料最少,因為管理功能 這種情況發生在檔案系統層。文件儲存支援權限和時間戳等基本屬性,但缺乏物件系統中那種豐富且可自訂的元資料框架。

工作量調整

物件儲存最適合非結構化資料和雲端原生應用程式。 AI 訓練資料集、備份、歸檔和分散式內容分發平台等場景對可擴展性和元資料靈活性要求極高。區塊儲存針對延遲敏感型工作負載(例如關聯式資料庫和交易系統)進行了最佳化,這些工作負載需要在作業系統層級實現可預測的效能。文件儲存通常部署在協作環境、共享使用者目錄以及依賴分層檔案系統中傳統文件存取協定的應用程式中。

物件儲存的主要優勢

物件儲存架構在結構和維運方面具有優勢,能夠支援大規模、資料密集的企業環境。與傳統的儲存區域網路 (SAN) 或縱向擴充網路附加儲存(NAS) 架構相比,物件儲存透過消除固定的容量限制,降低了運作複雜性。管理功能 以及分層縮放約束。

  • 橫向擴展成長-物件儲存系統透過向叢集新增節點來擴展容量,無需重新設計架構即可提升容量。這使其適用於PB級儲存庫、超大規模雲端平台以及AI 資料湖
  • 規模化成本效益-透過支援大容量磁碟機、高密度儲存伺服器和軟體定義儲存框架,物件儲存降低了長期保留非結構化資料(如備份、媒體存檔和分析資料集)的每TB成本。
  • 高持久性和資料保護-現代物件儲存平台採用糾刪碼和複製技術來維護跨磁碟、節點或站點的資料完整性。許多平台還支援物件不可變策略,有助於保護備份資料免受勒索軟體攻擊和未經授權的修改。
  • 地理分佈和彈性 - 物件儲存系統可以將資料分佈在資料中心或區域之間,從而支援災難復原、業務連續性策略和全球分散式應用程式存取。
  • 豐富的元資料和自動化功能—廣泛的元資料支援實現了智慧資料生命週期管理功能基於策略的分層,不可更改性法規符合性 用例和高效索引AI 以及分析資料集。
  • API 驅動的雲端整合 - S3 相容的儲存介面可與雲端原生應用程式、DevOps 工作流程、容器平台和混合雲架構無縫整合。

這些特性使物件儲存成為大規模分散式儲存環境中的核心架構元件。

常見用例

物件儲存部署於需要高效儲存、存取和管理大量非結構化資料的分散式系統中。其架構支援各種企業級和超大規模工作負載,而無需傳統檔案系統的限制。

雲端原生應用程式

現代雲端原生應用程式依賴可透過 API 存取的存儲,該儲存能夠與容器編排平台和微服務架構整合。物件儲存為無狀態應用層提供持久性資料服務,並支援雲端生態系統中廣泛採用的 S3 相容介面。

備份和歸檔

企業使用物件儲存作為備份儲存庫和長期資料保留。其分散式設計能夠可靠地儲存大型資料集,同時支援策略驅動的生命週期。管理功能 用於存檔和法規符合性 要求。

媒體儲存

媒體庫、串流平台和內容製作環境會產生需要集中儲存的大型二進位物件。物件儲存能夠實現高效率儲存。管理功能 支援跨製作和交付系統的分散式訪問,同時管理視訊、影像和音訊資源。

AI 訓練資料集

人工智慧和機器學習工作流程依賴對大量訓練資料集的存取。物件儲存充當集中式資料儲存庫,可在模型開發和重新訓練週期中為分散式運算叢集提供資料。

大數據分析

分析框架能夠攝取和處理大量結構化和非結構化資訊。物件儲存通常作為企業資料湖架構的基礎儲存層,將結構化和非結構化資料集整合到可擴展的儲存庫中。

內容散佈

物件儲存通常作為內容分發架構的來源層。儲存在物件儲存庫中的資料可以透過內容分發網路進行分發,以支援全球應用程式和媒體存取。

物件儲存AI 以及高性能環境

AI 高效能運算環境對AI儲存基礎架構提出了與傳統企業工作負載截然不同的要求。大規模模型訓練流程通常依賴包含數十億個物件的資料集,包括圖像、視訊幀、日誌檔案、嵌入向量和中間檢查點。這些資料集的規模通常達到數PB,並且必須保持可訪問性,以支援迭代的訓練、驗證和重新訓練工作流程。

資料存取和吞吐量要求

與優先考慮單一操作低延遲的事務處理系統不同, AI 訓練工作負載主要受吞吐量驅動。分散式訓練框架持續向圖形處理器 (GPU) 加速器傳輸數據,而儲存吞吐量不足會導致運算資源利用率低。採用橫向擴展配置的物件儲存系統可以聚合多個儲存節點的頻寬,從而提供持續的高讀取吞吐量,以滿足 GPU 叢集的資料消耗速率。

平行結構是…的決定性特徵AI 基礎架構方面,訓練作業通常運行在數十台甚至數百台支援 GPU 的伺服器上,每台伺服器都使用平行資料載入器並發擷取物件。對象儲存支援這種存取模型,允許獨立檢索對象,而無需文件鎖定限製或分層目錄遍歷。這種基於 API 的存取模型實現了高並發性,與跨多個運算節點運行的分散式訓練框架相契合。

基礎設施調整AI 工作量

高效能AI 環境需要儲存層、運算叢集和網路架構之間進行精心協調。高容量儲存伺服器為大型訓練語料庫提供密集儲存庫,而基於NVMe的儲存層可以加速頻繁存取的物件、元資料操作或活動資料集的暫存區域。在某些架構中,物件儲存網關與高速本地網路介面。 NVMe 使用緩衝區最佳化攝取和檢索效能。

網路架構在維持AI資料管道的穩定運作中起著至關重要的作用。高頻寬網路架構,例如 100GbE、200GbE、400GbE 等,或InfiniBand 將儲存叢集和 GPU 伺服器互連,以處理分散式訓練期間產生的大量東西向流量。即使儲存媒體效能充足,網路容量不足也可能造成瓶頸。

也應考慮資料保護策略。糾刪碼雖然能大規模提高儲存效率,但在重建或復原作業期間會增加運算開銷。 AI 在持續吞吐量至關重要的環境中,儲存架構師必須在持久性模型和效能要求之間取得平衡。

當採用適當的伺服器密度進行設計時, NVMe 隨著加速和高頻寬網路的發展,物件儲存成為基礎資料層。 AI 以及高性能環境。在大規模部署中,專為以下需求設計的百億億次級儲存架構: AI 基礎設施可以進一步提高效能效率和資料本地化。

物件儲存的基礎架構考量

企業級或超大規模物件儲存的設計需要周詳的架構規劃。容量成長、效能特徵、持久性模型以及資料中心的實體限制都會影響架構決策。與小型儲存部署不同,大規模物件儲存系統必須經過精心設計,以實現持續擴展和可預測的運作行為。

能力規劃

物件儲存環境通常從大規模開始,並隨著資料量的成長而不斷擴展。基礎設施必須支援這種漸進式成長,同時避免出現破壞性的重新配置或效能下降。

  • PB級成長-架構應支援橫向擴展,允許隨著容量需求從數百TB增加到數PB甚至更大而無縫添加儲存節點。
  • 資料生命週期管理功能 - 儲存設計應考慮分層策略、保留策略和歸檔工作流程,以便隨著時間的推移有效地管理活躍資料和不經常存取的資料。

產能規劃必須考慮硬碟 密度、機箱擴展能力和長期機架空間可用性,以防止代價高昂的重新設計。

表現

物件儲存環境的效能主要取決於總吞吐量和並發性,而非單次操作的延遲。基礎設施的規模必須與工作負載的行為相符。

  • 吞吐量與延遲 - AI分析和備份工作負載通常需要在多個節點上保持持續的讀寫吞吐量,而元資料密集型或小物件工作負載可能會引入延遲敏感性,需要進行調整。
  • 網路頻寬-高頻寬網路對於防止儲存節點和運算叢集之間出現瓶頸至關重要。橫向擴展物件儲存通常依賴 100GbE、200GbE 或更高頻寬的互連,以維持東西向流量和用戶端存取。

效能規劃應使儲存媒體、控制器功能和資料中心網路架構與預期的工作負載模式保持一致。

可靠性

耐用性和可用性是分散式物件儲存系統的核心設計要求,尤其是在企業和雲端服務供應商環境中。

  • 糾刪碼-糾刪碼在維持強大持久性保證的同時,提高了儲存效率。但是,架構師必須考慮節點或資料遺失期間的計算開銷和重建行為。硬碟 失敗。
  • 複製 - 在多站點或地理分佈的部署中,複製策略可防止站點層級故障並支援業務連續性要求。

可靠性模型應平衡儲存效率和重建能力windows以及服務水準目標。

功率和密度

高容量物件儲存系統,特別是採用頂部載入儲存配置的系統,會佔用大量的實體基礎架構。資料中心的限制條件必須與邏輯架構一併考慮。

  • 高容量硬碟-現代大尺寸硬碟可實現高密度儲存節點,進而降低大規模部署的每TB成本和機架佔用空間。
  • 機架密度-資料中心儲存伺服器密度會影響資料中心環境中的電源分配、佈線複雜性和長期可擴充性。
  • 散熱需求-高密度儲存配置會產生大量的熱量。充足的氣流設計和散熱能力,包括部署液冷系統,對於維持運作穩定性和延長硬體壽命至關重要。

功率和密度因素直接影響總擁有成本和基礎設施的長期可持續性。

雲端和混合式環境中的物件存儲

物件儲存已成為公有雲、私有雲和混合基礎設施策略的基礎組成部分。其 API 驅動的存取模型和分散式架構使企業能夠跨本地資料中心和雲端服務提供者一致地管理非結構化資料。隨著企業採用多雲營運模式,物件儲存提供了一個標準化的資料層,支援可攜性、自動化和長期可擴展性。

S3 相容性

Amazon S3 API 已成為物件儲存存取的業界標準。許多物件儲存平台都實現了與 S3 相容的接口,允許應用程式透過廣泛採用的 RESTful API 與儲存進行互動。這種相容性實現了應用程式在不同環境之間的可移植性,並減少了在本地基礎架構和公有雲平台之間擴展工作負載時的阻力。

在混合架構中,部署在私有資料中心內的 S3 相容儲存可以與公有雲物件儲存服務協同工作,並使用一致的存取方式。這種方法簡化了資料複製、工作負載遷移以及依賴基於 S3 通訊的分析或備份平台的整合。

軟體定義儲存

現代物件儲存平台通常以軟體定義儲存系統的形式交付。在這種模式下,資料放置、元資料管理等都由軟體定義。管理功能此外,持久性機制與底層伺服器硬體分離。這種抽象化使得系統能夠跨叢集式、符合業界標準的伺服器平台進行部署,同時允許透過基於節點的擴展來提升容量。

控制功能和資料功能的分離也支援雲端環境中常用的自動化和編排框架。基礎架構團隊可以以程式設計方式配置、監控和管理儲存資源,使儲存作業與雲端原生和 DevOps 方法保持一致。

與超大規模環境的集成

超大規模資料中心需要能夠以可預測的方式擴展並保持運行一致性的儲存架構。物件儲存透過將資料分佈在多個節點和故障域中,實現了跨機架或可用區的增量擴展,從而符合超大規模原則。

在大規模部署中,物件儲存系統通常與容器平台、分析叢集和分散式運算框架整合。混合擴展進一步支援私有基礎設施和公有雲區域之間的資料同步,從而支援策略驅動的複製和多站點可用性策略。

透過標準化的 API、軟體定義的部署模型和分散式系統設計,物件儲存為雲端和混合資料架構提供了一致的基礎。

為什麼基礎架構設計對物件儲存至關重要

大規模物件儲存系統依賴可擴展的伺服器平台、高容量儲存配置以及為持續資料吞吐量和長期成長而設計的最佳化網路架構。物件儲存軟體為資料的分發和管理提供了邏輯框架,而底層基礎設施最終決定了效能的穩定性、擴展能力和運作彈性。

隨著物件儲存庫規模成長到 PB 級甚至多 PB 級,基礎架構決策會直接影響效率和可管理性。伺服器密度,硬碟 節點選擇和配置會影響每個機架的容量、重建時間和每TB的總成本。系統必須經過精心設計,以支援節點的逐步擴展,而不會中斷正在進行的工作負載,從而確保儲存成長與資料成長保持一致。

網路架構同樣至關重要。分散式物件儲存叢集在資料跨節點重新平衡、複製或重建時會產生大量的東西向流量。同時,來自分析平台的面向客戶端的流量, AI 訓練叢集和雲端原生應用需要持續的頻寬。即使儲存媒體效能充足,網路設計不足也可能導致瓶頸。

可靠性和持久性模型也取決於基礎設施的選擇。糾刪碼和複製策略必須得到充足的運算資源和均衡的儲存配置的支持,才能在維護期間保持可預測的恢復行為。硬碟 或節點故障。在密集部署中,電源分配和散熱設計也會進一步影響系統穩定性和長期運作效率。

因此,高效的物件儲存部署不僅僅是選擇軟體那麼簡單。它需要對伺服器架構、儲存媒體、網路架構和資料中心設施進行協調規劃。當基礎架構與工作負載需求和預期成長相符時,物件儲存就能在保持效能、持久性和運作控制的同時,實現可預測的擴充。

常見問題解答

  1. 為什麼S3相容儲存對企業基礎架構至關重要?
    S3 相容儲存使企業能夠使用一致的 API 標準在私有雲和公有雲環境中運行應用程式。這降低了供應商鎖定風險,簡化了混合部署,並實現了資料可攜性,而無需對應用程式進行大量重新配置。
  2. 橫向擴充儲存與傳統儲存架構有何不同?
    橫向擴展儲存透過向叢集系統新增節點來提升容量和效能,而不是升級單一控制器。這種分散式模型支援增量擴展、可預測的效能擴展以及簡化操作。管理功能 與傳統的縱向擴充儲存平台相比。
  3. 物件儲存是否支援多租戶環境?
    物件儲存架構透過邏輯隔離、存取控制和命名空間分段來支援多租用戶部署。這使得服務提供者和大型企業能夠在共享基礎設施上安全地託管多個使用者或部門,同時保持治理和營運隔離。
  4. 對象儲存如何支援治理和法規符合性要求?
    物件儲存平台透過元資料驅動策略、保留控制、稽核日誌和不可變性功能來強化資料治理。這些功能有助於組織滿足監管要求、應用法律保留並維護資料的一致性。管理功能 跨分散式儲存環境。
  5. 物件儲存與 NAS 儲存相比有何不同?
    物件儲存與 NAS 的差異在於,物件儲存使用扁平命名空間和基於 API 的存取方式,而不是分層檔案系統和檔案協定。 NAS 針對共用檔案存取進行了最佳化,而物件儲存則專為大規模分散式資料環境而設計。
  6. 物件儲存和 Blob 儲存有什麼區別?
    Blob 儲存是雲端服務提供者常用的術語,用來描述物件儲存服務。兩者都將非結構化資料儲存為帶有元資料和唯一識別碼的對象,儘管不同供應商和平台的具體實作和 API 可能有所不同。