从S3导入数据到SLS面临多个技术挑战。首先是海量小文件的实时发现难题,许多AWS服务(如CloudTrail、ALB)会持续向S3写入小文件,每分钟可能产生成百上千个文件,如何快速发现新增文件并及时导入是核心问题。S3的ListObjects API只支持按字典序遍历,不支持按时间过滤,这意味着要找到最新文件可能需要遍历整个目录树。假设一个S3 bucket中已有上亿个历史文件,每分钟新增1000+文件,全量遍历可能需要数分钟才能完成一次扫描,无法满足实时性要求。其次是流量突发的弹性处理问题,日志量可能在业务高峰期急剧增长,数据导入系统需要具备弹性伸缩能力。此外还有数据完整性和一致性保障、网络传输的可靠性等挑战。




