先查数据再建模
拿到数据先做体检:缺失值、异常值、量纲是否一致、分组样本量是否悬殊。这些问题不先解决,后面的模型再漂亮也是错的。
从数据检查、统计建模到图表与解释,形成可以复核的分析过程和研究产物。
很多人对 AI 做数据分析的顾虑是一样的:它给了一个数,我怎么知道这个数是怎么来的、对不对。如果只能拿到结论拿不到过程,这个结论就没法用在论文或报告里。
研究智能体的做法是把分析写成代码再执行:它写脚本、跑数据、读运行结果、发现问题再改脚本,直到跑通。你拿到的不只是结论,还有完整的代码、中间输出和图表,任何一步都可以自己重跑一遍核对。这也是它和"直接让大模型算一下"最本质的区别——后者的数字是生成出来的,前者的数字是算出来的。
拿到数据先做体检:缺失值、异常值、量纲是否一致、分组样本量是否悬殊。这些问题不先解决,后面的模型再漂亮也是错的。
所有统计量都由实际执行的代码产出,不是模型凭印象写出来的数。代码和运行日志一并交付,可以逐行核对。
脚本报错或结果明显不合常理时,它会读报错信息、定位问题、修改后重跑,而不是把错误结果当成答案交上来。
坐标轴、图例、单位、误差棒该有的都有,可以直接放进论文或报告,不需要再返工排版。
这是我的问卷数据,想看看三组被试在这几个量表得分上有没有差异,该用什么方法你来判断。
先拿到数据质量报告(含两处异常值提示),然后是方法选择理由、检验结果、事后比较,以及一张可直接用于论文的分组对比图。
这份销售数据里,帮我找出影响转化率的主要因素,并说清哪些是相关、哪些能谈得上影响。
一份包含变量筛选过程、模型结果与稳健性检查的分析,明确区分了统计相关与可推断的影响,附完整代码。
区别在于数字的来源。直接问,模型是根据语言概率"写"出一个像样的数;这里是写代码在真实数据上算出来,代码和中间输出都交给你,可以自己重跑验证。
Excel、CSV 这些常见表格格式都支持,多张表可以一起上传做关联分析。数据量大时会分块处理。
图表和统计结果可以直接使用,代码可以作为补充材料。但方法是否契合你的研究设计、结论怎么表述,仍然需要你自己判断把关。
不会。上传的数据仅用于完成你当次的分析任务。