岗位描述(节选)
1、负责大规模多模态数据计算引擎的核心架构设计与执行计划优化,构建面向异构计算(CPU/GPU)的高效任务调度机制与执行流水线,解决PB级多模态数据(图像、音频、视频等)处理过程中的关键性能瓶颈;
2、应对PB级数据在Shuffle、Join、Aggregation等场景中面临的内存、I/O与存储资源挑战,攻克每日PB级流批一体数据处理过程中的系统稳定性难题了;
3、提供SQL-like与Python双端编程接口,打造从本地开发调试到生产级分布式计算的一站式开发体验,持续提升开发效率与工程易用性;
4、应对百PB级结构化数据及多模态数据入湖场景下的高效存储与高吞吐I/O挑战;实现多租户I/O与存储资源的有效隔离;构建完善的数据治理体系,保障数据质量,防范数据腐化风险。
【任职要求】
1、精通分布式系统原理,深入理解计算引擎(如 Spark、Flink、Ray、Daft等)的执行模型、任务……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。