データベース・データ管理– category –
-
データベース・データ管理
Apache Spark: 大規模データ処理フレームワーク
2010年にアパッチソフトウェア財団から誕生したApache Sparkは、Hadoopと並ぶ大規模分散処理技術として急速に普及。メモリ内計算機能により高速性能を実現し、データ分析の新しい時代を開いた。 【この記事の目次】 Sparkの基本概念 Sparkストリーミングと... -
データベース・データ管理
Apache Solr:検索エンジン用オープンソースソフトウェア
Apache Solrは、高度な検索機能を備えたリポジトリとして開発され、2004年頃にLuceneから分離。現在では全文検索やフリーテキスト検索を実現する代表的なシステムとなっています。 【この記事の目次】 Apache Solrの基本概念 Apache Solrの開発・進化 Apac... -
データベース・データ管理
Apache Samza: 分散ストリーム処理フレームワーク
Apache Samzaは、分散メッセージングシステムと関連するコンテナによるストリーム処理を担うフレームワークとして2014年にApacheソフトウェア財団に登録されました。Twitterの内部で開発され、その後オープンソース化されたSamzaは、高度なリアルタイムデ... -
データベース・データ管理
Apache Pinot: 高速リアルタイムデータ分析プラットフォーム
Apache Pinotは、リアルタイムでの大量データ処理を得意とするオープンソース・データ管理システムです。2013年にマイクロソフトが開発し始め、2018年にApacheのプロジェクトとなったPinotは、分散型アーキテクチャと効率的なストレージによって高性能な分... -
データベース・データ管理
Apache Parquet:効率的なデータ配列形式
Apache Parquetは、Apache Hadoopエコシステムで広く利用されている二進形式の列指向ファイルフォーマット。2013年に初めてリリースされ、その高い圧縮率とパフォーマンスにより一気に人気を博した。 【この記事の目次】 Apache Parquetとは Parquetの歴史... -
データベース・データ管理
Apache ORC: 高効率なデータストアフォーマット
Apache ORCは、Apache Hadoopエコシステムにおいて高速なデータアクセスを実現するための柱となるデータフォーマットです。2013年にデビューし、その後も継続的な改良が行われています。本記事ではORCの基本概念から進化した特性まで、その全貌に迫ります... -
データベース・データ管理
Apache Kylin: ビッグデータ時代のOLAPキューブエンジン
Apache Kylinは、アリババが開発したオープンソースのOLAPエンジンです。リアルタイムビッグデータ分析を可能にし、Hadoop上でのパフォーマンス向上に貢献しています。 【この記事の目次】 Apache Kylinとは Kylinの歴史と開発背景 Kylinのアーキテクチャ ... -
データベース・データ管理
Apache Ignite: 高性能分散メモリベースデータベース
Apache Igniteは、2013年にソースコードが開発者コミュニティに公開されて以来、急速に成長を遂げたオープンソースの分散コンピューテーションフレームワークです。データ処理とメモリクラウド機能により高速かつ柔軟なスケーラビリティを提供し、ビジネス... -
データベース・データ管理
Apache Iceberg: 分散データ処理の新たなフレームワーク
2017年にDatabricksによって開発されたApache Icebergは、大規模な分散システム向けにパフォーマンスとスケーラビリティを提供するためのオープンソースプロジェクトです。この技術はテーブル形式やメタデータストレージを簡潔化し、複数のデータ処理エン... -
データベース・データ管理
Apache Hudi: 大規模データ処理と更新の革命
Apache Hudiは、大規模なデータストア上で効率的なデータ更新や分析を可能にするフレームワークです。2015年にTwitterで開発され、その後Apacheソフトウェア財団に受け入れられました。Hudiは、データレイクの実現性を高め、リアルタイムデータ処理とOLAP...
