围中形状不同的样本
。
从样本质量比上看
,
当质量
比升高时
,
吸光度曲线的形状发生明显改变
。
尤其
是质量比大于
90 mg / kg
后
,
吸光度值和质量比之间
的非线性关系更明显
。
这主要是因为质量比较高
时
,
氯化钯完全反应
,
氧乐果有剩余
,
谱线的区分度
不再明显
,
发生的比色反应不能再体现吸光度和质
量比之间的关系
。
因此
,
有必要先建立分级模型
,
定
性判断氧乐果浓度
。
图
3摇 3
个典型的氧乐果样本吸光度谱图
Fig. 3摇 Absorbance spectra of 3 typical omethoate samples
2郾 2摇
利用
SVM
建立三分类模型
依据前面分析的不同质量比范围氧乐果吸光度
曲线的差异
,
将
60
个样本分为
0郾 5 ~ 50 mg / kg(35
个样本
)、52 ~ 88 mg / kg(10
个样本
)、90 ~ 400 mg / kg
(15
个样本
)3
个范围
,
进行三分类建模
,
利用
5鄄
折
交叉验证
。
目前为止
,SVM
预测建模时各项参数的选择尚
无统一模式
,
需要经过大量的参数尝试
。
影响分类
精度的主要因素有
:
数据的归一化
,
核函数类型
,
参
数
c
和
g
的值
。
分别使用原始数据
、
数据归一化为
[0,1]
和归
一化为
[ - 1,1] 3
种情况作为
SVM
建模数据
。
关键问题是寻求最佳的
c
值和
g
值
。
将
c
和
g
的搜索空间分别设定为
:
c
= [2
- 3
,2
12
],
g
= [2
- 12
,
2
1
]。
利用
5
鄄
折交叉验证法会造成不同的
c
和
g
都
对应最高的准确率
,
虽然较高的惩罚参数
c
能使得
validation
数据的准确率提高
,
但过高的惩罚参数
c
会造成过学习状态
,
往往导致最终测试集合的准确
率并不是很理想
,
因此
c
不能设置太高
。
本研究中
,
在保证精确度的前提下
,
把具有最小
c
的那组
c
和
g
认为是最佳的
c
和
g
。
结合不同的核函数
,
运行程序产生的最佳
c
值
、
g
值和测试集合的精确度
(
精确度
=
分类正确的样
本数
/
测试集总样本数
)
分别列于表
1。
可以看出
:
将数据归一化为
[0,1]
的效果明显好于归一化为
[ - 1,1],
略好于原始数据
;
径向基核函数与线性和
多项式函数相比表现出较大优势
,
利用
Sigmoid
函
数虽然精确度也能达到
96郾 774 2
%
,
但同时惩罚参
数
c
却是
32,
远远高于使用径向基函数的
c
= 1。
表
1摇
不同数据处理方法对建模效果的影响
Tab. 1摇 Effects of different data processing methods
on model accuracy
方法 核函数
bestc
值
bestg
值 精确度
Linear
0郾 125 0 2郾 441 4 伊 10
-4
90郾 322 6
原始数据
Poly
0郾 125 0
0郾 062 5 80郾 645 2
RBF
1
0郾 031 3 93郾 548 4
Sigmoid
4
0郾 015 6 93郾 548 4
Linear
2 2郾 441 4 伊 10
-4
90郾 322 6
[0,1]
标准化
Poly
0郾 125 0
0郾 0313
87郾 096 8
RBF
函数
1
0郾 062 5 96郾 774 2
Sigmoid
32
0郾 002 0 96郾 774 2
Linear
0郾 125 0 2郾 441 4 伊 10
-4
80郾 645 2
[ - 1,1]
标准化
Poly
0郾 250
0郾 002 0 77郾 419 4
RBF
2 2郾 441 4 伊 10
-4
83郾 871 0
Sigmoid 2 048
0郾 002 0 67郾 741 9
摇 摇
因此预测模型选用将吸光度数据归一化为
[0,1],
并使用
RBF
函数
,
此时交叉验证的精确度达
到
96郾 774 2% ,
较佳的
c
值和
g
值分别为
1
和
0郾 062 5。
图
4
和图
5
分别是
c
值和
g
值的网格搜索
图和等高线图
。
图
4摇
较佳
c
和
g
网格
3D
图
Fig. 4摇 Optimal
c
and
g
in 3D view
3摇
结
摇
论
为快速
、
安全地检测白菜中氧乐果农药残留
,
研
究了质量比在
0郾 5 ~ 400 mg / kg
中的
60
个不同浓度
67
食品科学技术学报
摇 摇 摇 摇 摇 摇 摇 摇 摇 摇 摇 摇 摇 摇 摇 摇
摇 2015
年
9
月