关于数模workflow搭建的thinking和plan
这部分包含着答辩老师提供的信息,我的一些反思,还有关于后续例如skill的创建,workflow的搭建,甚至于简单的Agent的搭建等。
关于AI
不能对 AI 生成的代码抱有侥幸心理,根据老师的说法,直接复制粘贴甚至连“变量名”都可能无法通过查重系统。我对此深有感悟,许多AI给出的公式其变量的设置字母会非常的奇怪甚至是“反常识”,以及可能使用生僻的英文单词首字母来当变量名(比如我自己起名可能是A,B,C)。根据林加云的说法,代码全部得自己过一遍改一下,至少降低所谓的代码的AI味。
那么对于建模来说,我觉得一开始问AI会有一种先入为主的感觉,我自己最近反思以后还是认为在拿出赛题后至少先思考,如果是大数据统计类的题,我有经验,就应该先判断一下模型是什么,然后再问AI,避免一开始的思路就受到影响。这就牵扯到所谓的查重率的问题。我相信大部分队伍的策略都是一开始马上问AI,对于不同的模型,其参数权重差异可能导致不同的结果,所以我认为如GPT,deepseek这类过于popular的LLM就不太适合用来确定思路,可能要用claude或者kimi好一些,后续细化的话倒是无所谓。当然这个前提是建立在足够的知识积累上,后续还要继续努力学习。然后我觉得可以多看看书,现在书本估计都没啥人看了,不存在所谓的重复率问题了。
关于skill
我已经根据b站的视频制作了skill了,具体的内容我也还没细看,我觉得等日后有空的话可以仔细审视一下GPT封装的这个skill。可以先吸收他人的。github我现在是发现了不少开源的skill,我觉得有时间可以批判性看看。与此同时也不只是数学建模的skill,一些build project或者是一些大牛自己的skill也可以看看,然后给各类Agent装上同一套的skill。
还有自己build自己的skill。我能想到的就是比如“降低AI味”的skill和论文输出格式的skill。顺带提一嘴,我感觉现在我的论文过于based on AI了,我自己纯手搓的内容还不是太多。这也就引出了我还是要多学学写论文,尽量保证多一点手搓,这样不管是整个论文框架思路还是学术能力锻炼都比较有帮助。说回来,我可以和codex对话一下,遍历一下跟数模相关的所有对话,提炼出我的“喜好”,封装成skill。
复盘
数量压降至 5-6 个,按重要性降序排列;涵盖维度:问题背景、构建的模型、解法方法、实际意义;严禁英文缩写及未翻译名词。
全局英文/数字强制 Times New Roman。
关于优化类问题,需要目标函数,约束条件,决策变量,求解方法,最优方案是否满足约束,缺一不可,需要体现;
统计模型需要体现表达式、参数估计、统计检验、显著性结果;
模型的建模步骤要具体体现;
部分的细化部分可以不在公式里体现(例如线性组合权重系数的确定);
多阅读优秀论文;
算法的部分可以批判性省略,主流算法可以一笔带过,算法中途的实现并不重要;
公式变量解释放在公式前,符号说明需要全一点;
用机器学习时一定注意数据数量的问题;
特别留意检查一下跑出来的数据有没有问题;
用纸笔梳理一下思路对于而言效率更高;
梳理清楚逻辑的一个表现就是后面可以based on前面的建模或者处理,能连上,不要堆模型;
收着写,20页出头就行;
注意正文也可以进行加粗操作;
要非常明确地对图表进行解释;
模型检验极其重要。