編集長– Author –
-
データベース・データ管理
DataStax Enterprise: クラウドネイティブNoSQLデータベース
DataStax Enterpriseは、Apache Cassandraを基盤とする分散型データベース製品です。2010年に設立されたDataStaxが開発し、多くの大規模システムで採用されています。本記事では、その進化と特徴、実践的な利用例について掘り下げます。 【この記事の目次... -
データベース・データ管理
DataStax Astra DB: 分散データベース管理ツール
DataStax Astra DBは、Apache Cassandraを基盤とするクラウドネイティブな分散型データベースサービスです。2019年にリリースされ、開発者に柔軟で信頼性の高いデータ管理ソリューションを提供しています。 【この記事の目次】 DataStax Astra DBの特徴 Da... -
AI・機械学習・データサイエンス
Datasheets for Datasets: データセット管理の新たな枠組み
2021年に発表されたDatasheets for Datasetsは、機械学習モデル開発におけるデータセットの透明性と追跡可能性を高める手法として注目を集めました。本記事では、この概念の背景、目的、そして今後の展開について詳しく解説します。 【この記事の目次】 Da... -
未分類
HuggingFace datasets: 大規模な学習データ集
2018年に設立されたオープンソースのプラットフォーム、Hugging Faceが提供するdatasetsは、自然言語処理モデルを訓練するための大規模なデータセットをホストしています。ここでは、その仕組みと特長について詳しく解説します。 【この記事の目次】 Huggi... -
未分類
Dataset.select(): データ抽出メソッド
Pythonのデータ処理や機械学習フレームワークにおいて、Dataset.select()は重要な役割を果たします。この関数を使用することで、特定の条件に該当するレコードを効率的にフィルタリングできます。 【この記事の目次】 Dataset.select(): 概要と目的 Datase... -
未分類
Dataset.map(): データ処理を簡潔に表すメソッド
PythonのデータサイエンスライブラリであるPyTorchやTensorFlowでは、データセットの操作を効率的に実装するための重要な関数としてDataset.map()が利用されています。この記事では、この関数の起源から最新の応用までを詳しく解説します。 【この記事の目... -
未分類
Dataset.filter(): データセットから条件にマッチするレコードを抽出
Dataset.filter()は、機械学習プロジェクトにおいて重要な役割を果たすメソッドです。PythonのPandasライブラリにおけるfilter関数は、データ解析の初期段階で大量のデータから特定のレコードだけを選別するために使用されます。 【この記事の目次】 Datas... -
ビジネスIT・DX・SaaS
DataRobot: AIプラットフォームの先駆者
2012年に設立されたDataRobotは、機械学習とAIを容易に利用可能にするためのSaaS型ソフトウェアを開発。金融、製造業など多様な業界で活用され、近年では自動化によるモデル開発における革新性が評価されている。 【この記事の目次】 DataRobotとは DataRo... -
ネットワーク・インフラ・クラウド
Google Dataproc Serverless: クラウド上でのビッグデータ処理
2019年にGoogle Cloudによって導入されたDataproc Serverlessは、サーバーレスのアプローチを採用し、ビッグデータ処理における管理負担を大幅に軽減しました。この記事では、その仕組みや機能について詳しく解説します。 【この記事の目次】 Dataproc Ser... -
ネットワーク・インフラ・クラウド
Dataproc: Google Cloud Platform上のビッグデータ処理
2017年に登場したGoogle Cloud Dataprocは、HadoopとSparkを簡素化し高度な分析作業を可能にします。本記事ではその概要、機能強化の経緯、および他のクラウドサービスとの比較を取り上げます。 【この記事の目次】 Dataprocとは何か Dataprocの進化 Datap...
