Recent Posts
- Connected Component from DFS to BigQuery
连通分量计算是图论中最基础、最重要的问题之一。本文将梳理这个问题从经典单机算法到分布式大规模算法的完整演进历程,最终到达 2014 年 Google 论文提出的 Alternating Algorithm:一个至今仍被广泛使用的工业级解决方案。
- Retrospective 2025
2025 年回顾和新年展望。
- From Databricks to Dataproc
把一个 Spark 数据处理项目从 Databricks 迁到 GCP Dataproc 的实录:Serverless 的会话启动缓慢与依赖分发难题,Cluster 的访问方式、依赖安装与磁盘规划,还有 BigQuery 的内部错误和工单支持带来的额外惊喜。
- A Slight Diffs on Coordinate
GPS 坐标到底是怎么定义的?为什么不同来源的数据会有坐标误差?地球的重力场又是如何影响坐标计算的?
- Logis-Tech Tokyo INNOVATION EXPO 2025
东京国际物流展闭幕日两小时的观展记
- Map Matching as Service
MobilityDB 团队地图匹配综述的中文翻译:问题定义与轨迹、路网数据格式,现有方法的分类,隐马尔可夫模型地图匹配的定义与各类优化,以及主流地图匹配工具的评估与基准测试。
- Unterstanding Rust’s Vec and its capacity for fast and efficient programs
转载 Markus Jais 的经典文章。通过一组打印 len 与 capacity 的小实验,看清 Vec 在 push、reserve、reserve_exact、clear 和 shrink_to_fit 之下的扩容与缩容行为,以及它们对程序性能的影响。
- The A Star Algorithm
从优先级函数 f(n)=g(n)+h(n) 出发梳理 A* 算法的完整流程,并讨论启发函数如何决定它在 Dijkstra 与最佳优先搜索之间的位置,以及网格图上曼哈顿距离、对角距离和欧几里得距离的取舍。
- Azure Databricks 踩坑记录
databricks-connect 的 master URL 未设置、RPC 结果丢失、远端找不到 Java 类、Scala 序列化失败,Notebook 里的 expr 与 ST_GeomFromWKB,以及 Cluster 上的 Java heap space —— 在 Azure Databricks 上踩过的坑和对应的解法汇总。
- Barefoot 中的隐马尔可夫地图匹配
讨论开源项目 Barefoot 如何使用隐马尔可夫模型把一串 GPS 位置测量还原成地图上的移动轨迹,包括支撑在线匹配的 k-State 数据结构及其 JSON 交互格式。
- Towards Transparent CPU Scheduling
Joseph T. Meehean 博士论文《Towards Transparent CPU Scheduling》的中文翻译。为什么通用 CPU 调度器对用户和开发者近乎黑盒,以及 CPU Futures 的预测模型与 Harmony 的实验框架如何把 O(1)、CFS、BFS 的调度策略反推出来。
- Some topics about CPU Cache
如何在 Linux 上查到 CPU 各级 cache 的容量与行宽?又该如何在测量之前把 cache 清干净?前者用 getconf、sysconf 和 sysfs 三种方式回答,后者则要在大量访存、空等和特殊 CPU 指令之间做选择。