Class TabularDataSet<T extends MLDataItem>

java.lang.Object
javax.visrec.ml.data.BasicDataSet<T>
deepnetts.data.TabularDataSet<T>
Type Parameters:
T - Type of elements in this data set.
All Implemented Interfaces:
Iterable<T>, javax.visrec.ml.data.DataSet<T>
Direct Known Subclasses:
ImageSet

public class TabularDataSet<T extends MLDataItem> extends javax.visrec.ml.data.BasicDataSet<T>
Basic data set with tabular data. Used for training neural networks in Deep Netts.
  • Field Details

    • columnNames

      protected String[] columnNames
  • Constructor Details

    • TabularDataSet

      protected TabularDataSet()
    • TabularDataSet

      public TabularDataSet(int numInputs, int numOutputs)
      Create a new instance of BasicDataSet with specified size of input and output.
      Parameters:
      numInputs - number of input features
      numOutputs - number of output features
  • Method Details

    • getNumInputs

      public int getNumInputs()
    • getNumOutputs

      public int getNumOutputs()
    • split

      public javax.visrec.ml.data.DataSet[] split(int parts)
      Split data set into specified number of part of equal sizes. Utility method used during cross-validation Note: this could be default method
      Parameters:
      parts -
      Returns:
    • trainTestSplit

      public TrainTestSplit trainTestSplit(double splitRatio)
    • split

      public javax.visrec.ml.data.DataSet[] split(double... parts)
      Splits data set into several parts specified by the input parameter partSizes. Values of partSizes parameter represent the sizes of data set parts that will be returned. Part sizes are decimal values that represent percents, cannot be negative or zero, and their sum must be 1
      Specified by:
      split in interface javax.visrec.ml.data.DataSet<T extends MLDataItem>
      Overrides:
      split in class javax.visrec.ml.data.BasicDataSet<T extends MLDataItem>
      Parameters:
      parts - sizes of the parts in percents
      Returns:
      parts of the data set of specified size
    • shuffle

      public void shuffle()
      Shuffles the data set items using the default random generator. Default rng can be initialized independently
    • shuffle

      public void shuffle(int seed)
      Shuffles data set items using java random generator initializes with specified seed
      Parameters:
      seed - a seed number to initialize random generator
      See Also:
    • getColumnNames

      public String[] getColumnNames()
      Overrides:
      getColumnNames in class javax.visrec.ml.data.BasicDataSet<T extends MLDataItem>
    • setColumnNames

      public void setColumnNames(String... columnNames)
      Overrides:
      setColumnNames in class javax.visrec.ml.data.BasicDataSet<T extends MLDataItem>
    • getTargetColumnsNames

      public String[] getTargetColumnsNames()
      Specified by:
      getTargetColumnsNames in interface javax.visrec.ml.data.DataSet<T extends MLDataItem>
      Overrides:
      getTargetColumnsNames in class javax.visrec.ml.data.BasicDataSet<T extends MLDataItem>
    • hasMissingValues

      public boolean hasMissingValues(int colIdx)
    • hasMissingValues

      public boolean[] hasMissingValues()
    • countMissingValues

      public int countMissingValues(int colIdx)
    • countMissingValues

      public int[] countMissingValues()