2023-11-16 16:30:00 ~ 2023-11-17 16:30:00
Netflix的Membership and Finance Data Engineering团队负责处理与计划、定价、会员生命周期和收入相关的多样化数据,以支持分析、驱动各种仪表盘,并做出数据驱动的决策。然而,当数据延迟到达时,管理数据可能会带来很大的挑战。为了解决这个问题,团队开发了一个增量数据处理框架Psyberg。这个框架可以处理延迟到达的数据,并确保数据的准确性和完整性。通过这个系列的博客文章,读者可以了解Psyberg框架的内部机制、独特特性以及如何与数据流水线集成。Psyberg框架的使用使得数据处理更加高效、准确和及时。
Psyberg是一个数据处理平台,支持无状态和有状态的数据处理模式。对于无状态模式,它根据提供的输入检测Iceberg快照的变化,并将相关信息存储在psyberg_session_f表中。对于有状态模式,它可以处理多个输入流,并根据不同的时间戳字段来跟踪源表快照的变化。无论是哪种模式,Psyberg都能解析出每个Iceberg快照的分区信息。
本文介绍了在eBay的NuGraph分析插件中,作者使用JanusGraph和Spark进行图导出,并通过优化Tinkerpop的SparkGraphComputer和CloneVertexProgram解决了性能问题。作者还介绍了基于导出图的图结构分析方法,并提到了实现顶点度分布的幂律分布模型。作者还提到了解决处理数十亿顶点和边时出现的JVM内存管理问题的技术和改进。此外,文章提供了一些相关工具和资源的链接,包括FoundationDB、Supernode问题的解决方案、Gremlin查询语言、Nebula Algorithm、Async-profiler和Memory Analyzer。
登录后可查看文章图片
本文介绍了Psyberg如何帮助自动化处理数据管道的端到端补偿,包括维度表。文章首先介绍了Psyberg的核心操作模式,即无状态和有状态数据处理。然后,介绍了在集成Psyberg后管道的状态。文章详细解释了Psyberg如何处理延迟到达的数据,并提供了一个通用的处理流程。最后,强调了Psyberg的优点和适用性。文章总结了如何将Psyberg与客户生命周期的四个组件集成,实现自动补偿。
数据存储团队通过实施限流机制和断路器模式,有效地保护数据库免受过多查询的影响。他们还采用了指数退避算法来适应失败的作业,并停止重试。此外,忘记用户作业通过优化查询和减少负载,对减轻主数据库压力发挥了重要作用。这些措施有助于确保Slack数据库基础设施的稳定性和可靠性,提供流畅的用户体验,并减轻类似事件的影响。
登录后可查看文章图片
Airbnb开发了LAEP系统,利用机器学习和自然语言处理技术从非结构化文本数据中提取有用的房源信息。LAEP系统包括命名实体识别、实体映射和实体评分组件,能够从文本中提取房源属性并将其映射到标准实体名称。该系统应用于下游应用程序,帮助团队发现新的房源类别和重要的房源属性,提升房源理解和服务质量。
登录后可查看文章图片
2023年8月4日 21:00-21:20 云厂商 CDN 服务故障,回源流量突增导致 BFS SLB 过载,影响依赖图片、JS/CSS静态资源的服务,大量用户出现白屏和无法播放视频的问题。
登录后可查看文章图片
为了解决信息孤岛问题,达达7条业务线共43个站点应用接入京东子午线,复用集团的统一埋点采集能力和埋点平台,降低自研埋点采集研发投入和成本,打通数据链路,创造更多的数据分析价值,也为其他应用接入子午线提供借鉴和参考 。
登录后可查看文章图片
在百度APP包体积优化实践中,编译器优化包括GCC语言编译优化、Swift编译优化、LTO优化、Asset 优化、XCode升级优化和Swift内置动态库优化等,编译器方向的优化是所有优化手段中ROI最高的,成功减少了30M的包体积。
登录后可查看文章图片
关注公众号
接收推送