• 数据的价值与数据的新近程度成正比。我们可以使用内存数据库来提高速度和价值生成吗?DuckDB 在这一承诺上获得了很多关注,Dagster 团队撰写了关于其建立在 DuckDB、Parquet 和 Dagster 之上的实验性数据仓库的文章。 Duc
  • 在 Back Market 的数据工程实习期间,我专注于为我们的内部数据消费者设计和集成数据沿袭平台。本文收集了我学到的关于如何快速识别不同类型的数据沿袭(数据世系data lineage)的关键经验。下面的文章将重点介绍实现。 可以将数据沿袭/数
  • Netflix 撰写了有关 Metacat 的文章,这是一个充当所有数据存储的联合元数据访问层的系统。各种计算引擎的集中式服务可以用来访问不同的数据集。Metacat 采用了一种有趣的架构模式,其中各个元数据存储仍然是模式元数据的真实来源,而 Metacat 并未在其存储中实现它。 icon
  • SQL的基础是在关系型数据库的黎明时期奠定的。那时,还没有数据仓库,没有商业智能工具,当然也没有分析工程师这样的东西。然而,SQL仍然是大多数数据专业人员与他们的原始材料进行交互的主要用户界面。底层技术已经有了不可估量的改进,但除了对ANSI标准的少量更新外,语言的核心仍然没有改变。在无数数 icon
  • Paypal 撰写了关于通用数据目录 (UDC) 从 2017 年孵化开始的演变。该博客讲述了 UDC 的增长如何帮助 Paypal 弃用多个重复的基础架构,以及 Paypal 为何采用拉模型来获取元数据。 元数据对 PayPal 来说并不新鲜。创 icon
  • Airbnb 开发了 DataPortal 以使数据民主化,并通过帮助数据探索、发现和信任来帮助 Airbnb 员工获得数据知情权。这篇文章非常适合阅读,详细介绍了数据发现工具的碎片化数据格局和数据建模技术。 与许多初创公司一样,Airbnb 的员 icon
  • Shopify 撰写了有关 Artifact、其数据发现和数据管理工具的文章,以提高生产力、提供更大的数据可访问性并允许更高级别的数据治理。该博客讲述了构建数据发现服务的挑战,从获取元数据到转换、建模和应用以使其更易于使用。 数据使用的本质是问题驱 icon
  • 当时Hortonworks的Apache Atlas项目加入了Apache孵化器项目,专注于为企业提供开放的元数据管理和治理能力,以建立其数据资产的目录,对这些资产进行分类和治理,并为数据科学家、分析师和数据治理团队提供围绕这些数据资产的协作能力。Apache Atlas于2017年 icon
  • Facebook 写了关于其数据发现引擎 Nemo 的文章。Nemo 有两个主要组件,索引和服务,前端位于服务部分的顶部。索引又分为每天发生的批量索引和立即更新索引的即时索引。对于 Serving,Nemo 对采用基于 spaCy 的 NLP 库特别感兴趣,该库执行文本解析和 ML 方法进行 icon
  • 优步写了一篇关于其运行 Databook 的经验的反映,并随着时间的推移对其进行了演变。该博客讲述了结构良好、管理良好的元数据、专注于用户体验的集中式元数据系统以及可扩展数据模型的重要性。 每天在全球 10,000 多个城市,数百万人依靠优步出行、 icon
  • Spotify 撰写了有关 Lexicon 的文章,这是一种数据发现服务,旨在改善数据科学家的数据发现体验。该发现侧重于个性化,例如在整个组织中查找流行的数据集,为团队查找相关数据集,并建议每个人都应该注意。 在 Spotify,我们坚信基于数据的 icon
  • Expedia 撰写了关于其使用无监督学习对客户反馈进行分类的方法。我的一部分想知道,云提供商可以开箱即用地提供这些解决方案,难道不应该是一个已解决的问题吗? 在Expedia Group ,我们努力为旅客提供无摩擦的方式来提出他们的疑问、投诉或反 icon
  • 在 Shopify,我们接受了全栈数据科学的理念,并且经常被问到“成为全栈数据科学家意味着什么?”。该术语最近在数据行业中出现了激增,但似乎没有就定义达成共识。因此,我们与几位 Shopify 数据科学家聊天,分享我们的定义和经验。 icon
  • ODD 是面向数据团队的开源数据发现和可观察性工具,有助于通过现代用户友好的环境有效地实现数据民主化、加强协作并减少数据发现时间。关键特点: 缩短数据发现阶段 对数据的使用方式和使用者保持透明 通过持续的合规性和数据质量监控来培养数据文化 加速 icon
  • 首先,我想讨论几个数据工程的具体方面:可见性、协作和多样性(技能)。 可见性鉴于数据工程工作的性质,在许多公司,数据工程经常生活在数据科学的阴影之下。因此,数据工程团队的可见性往往是一个问题,直接影 icon
  • 在过去的几周里,数据合约一直是一个热门话题: Chad 发表了数据合约的工程指南, Jake 发表了 icon
  • 人们总是倾向于寻找证据来证实他们的想法。人们倾向于以强化个人信念或假设的方式搜索、解释、偏好和回忆信息。 Willard V. Quine 和 JS Ullian 在 icon
  • 数据仓库有很多定义,现在最重要的两个是: Ralph Kimball对数据仓库的定义 数据仓库是专门为查询和 icon