/[escript]/trunk/ripley/src/Rectangle.cpp
ViewVC logotype

Diff of /trunk/ripley/src/Rectangle.cpp

Parent Directory Parent Directory | Revision Log Revision Log | View Patch Patch

branches/ripleygmg_from_3668/ripley/src/Rectangle.cpp revision 3791 by caltinay, Wed Feb 1 05:10:22 2012 UTC trunk/ripley/src/Rectangle.cpp revision 4712 by sshaw, Wed Feb 26 04:08:41 2014 UTC
# Line 1  Line 1 
1    
2  /*******************************************************  /*****************************************************************************
3  *  *
4  * Copyright (c) 2003-2012 by University of Queensland  * Copyright (c) 2003-2014 by University of Queensland
5  * Earth Systems Science Computational Center (ESSCC)  * http://www.uq.edu.au
 * http://www.uq.edu.au/esscc  
6  *  *
7  * Primary Business: Queensland, Australia  * Primary Business: Queensland, Australia
8  * Licensed under the Open Software License version 3.0  * Licensed under the Open Software License version 3.0
9  * http://www.opensource.org/licenses/osl-3.0.php  * http://www.opensource.org/licenses/osl-3.0.php
10  *  *
11  *******************************************************/  * Development until 2012 by Earth Systems Science Computational Center (ESSCC)
12    * Development 2012-2013 by School of Earth Sciences
13    * Development from 2014 by Centre for Geoscience Computing (GeoComp)
14    *
15    *****************************************************************************/
16    
17  #include <ripley/Rectangle.h>  #include <ripley/Rectangle.h>
 extern "C" {  
18  #include <paso/SystemMatrix.h>  #include <paso/SystemMatrix.h>
19  }  #include <esysUtils/esysFileWriter.h>
20    #include <ripley/DefaultAssembler2D.h>
21    #include <ripley/WaveAssembler2D.h>
22    #include <ripley/LameAssembler2D.h>
23    #include <ripley/domainhelpers.h>
24    #include <boost/scoped_array.hpp>
25    #include "esysUtils/EsysRandom.h"
26    #include "blocktools.h"
27    
28    #ifdef USE_NETCDF
29    #include <netcdfcpp.h>
30    #endif
31    
32  #if USE_SILO  #if USE_SILO
33  #include <silo.h>  #include <silo.h>
# Line 26  extern "C" { Line 39  extern "C" {
39  #include <iomanip>  #include <iomanip>
40    
41  using namespace std;  using namespace std;
42    using esysUtils::FileWriter;
43    
44  namespace ripley {  namespace ripley {
45    
46  Rectangle::Rectangle(int n0, int n1, double x0, double y0, double x1,  Rectangle::Rectangle(int n0, int n1, double x0, double y0, double x1,
47                       double y1, int d0, int d1) :                       double y1, int d0, int d1,
48      RipleyDomain(2),                       const std::vector<double>& points,
49      m_gNE0(n0),                       const std::vector<int>& tags,
50      m_gNE1(n1),                       const simap_t& tagnamestonums) :
51      m_x0(x0),      RipleyDomain(2)
52      m_y0(y0),  {
53      m_l0(x1-x0),      // ignore subdivision parameters for serial run
54      m_l1(y1-y0),      if (m_mpiInfo->size == 1) {
55      m_NX(d0),          d0=1;
56      m_NY(d1)          d1=1;
57  {      }
58    
59        bool warn=false;
60        std::vector<int> factors;
61        int ranks = m_mpiInfo->size;
62        int epr[2] = {n0,n1};
63        int d[2] = {d0,d1};
64        if (d0<=0 || d1<=0) {
65            for (int i = 0; i < 2; i++) {
66                if (d[i] < 1) {
67                    d[i] = 1;
68                    continue;
69                }
70                epr[i] = -1; // can no longer be max
71                //remove
72                if (ranks % d[i] != 0) {
73                    throw RipleyException("Invalid number of spatial subdivisions");
74                }
75                ranks /= d[i];
76            }
77            factorise(factors, ranks);
78            if (factors.size() != 0) {
79                warn = true;
80            }
81        }
82        
83        while (factors.size() > 0) {
84            int i = epr[0] > epr[1] ? 0 : 1;
85            int f = factors.back();
86            factors.pop_back();
87            d[i] *= f;
88            epr[i] /= f;
89        }
90        d0 = d[0]; d1 = d[1];
91        
92      // ensure number of subdivisions is valid and nodes can be distributed      // ensure number of subdivisions is valid and nodes can be distributed
93      // among number of ranks      // among number of ranks
94      if (m_NX*m_NY != m_mpiInfo->size)      if (d0*d1 != m_mpiInfo->size)
95          throw RipleyException("Invalid number of spatial subdivisions");          throw RipleyException("Invalid number of spatial subdivisions");
96    
97      if ((n0+1)%m_NX > 0 || (n1+1)%m_NY > 0)      if (warn) {
98          throw RipleyException("Number of elements+1 must be separable into number of ranks in each dimension");          cout << "Warning: Automatic domain subdivision (d0=" << d0 << ", d1="
99                << d1 << "). This may not be optimal!" << endl;
100        }
101    
102        double l0 = x1-x0;
103        double l1 = y1-y0;
104        m_dx[0] = l0/n0;
105        m_dx[1] = l1/n1;
106    
107        if ((n0+1)%d0 > 0) {
108            n0=(int)round((float)(n0+1)/d0+0.5)*d0-1;
109            l0=m_dx[0]*n0;
110            cout << "Warning: Adjusted number of elements and length. N0="
111                << n0 << ", l0=" << l0 << endl;
112        }
113        if ((n1+1)%d1 > 0) {
114            n1=(int)round((float)(n1+1)/d1+0.5)*d1-1;
115            l1=m_dx[1]*n1;
116            cout << "Warning: Adjusted number of elements and length. N1="
117                << n1 << ", l1=" << l1 << endl;
118        }
119    
120      if ((m_NX > 1 && (n0+1)/m_NX<2) || (m_NY > 1 && (n1+1)/m_NY<2))      if ((d0 > 1 && (n0+1)/d0<2) || (d1 > 1 && (n1+1)/d1<2))
121          throw RipleyException("Too few elements for the number of ranks");          throw RipleyException("Too few elements for the number of ranks");
122    
123        m_gNE[0] = n0;
124        m_gNE[1] = n1;
125        m_origin[0] = x0;
126        m_origin[1] = y0;
127        m_length[0] = l0;
128        m_length[1] = l1;
129        m_NX[0] = d0;
130        m_NX[1] = d1;
131    
132      // local number of elements (with and without overlap)      // local number of elements (with and without overlap)
133      m_NE0 = m_ownNE0 = (m_NX>1 ? (n0+1)/m_NX : n0);      m_NE[0] = m_ownNE[0] = (d0>1 ? (n0+1)/d0 : n0);
134      if (m_mpiInfo->rank%m_NX>0 && m_mpiInfo->rank%m_NX<m_NX-1)      if (m_mpiInfo->rank%d0>0 && m_mpiInfo->rank%d0<d0-1)
135          m_NE0++;          m_NE[0]++;
136      else if (m_NX>1 && m_mpiInfo->rank%m_NX==m_NX-1)      else if (d0>1 && m_mpiInfo->rank%d0==d0-1)
137          m_ownNE0--;          m_ownNE[0]--;
138    
139      m_NE1 = m_ownNE1 = (m_NY>1 ? (n1+1)/m_NY : n1);      m_NE[1] = m_ownNE[1] = (d1>1 ? (n1+1)/d1 : n1);
140      if (m_mpiInfo->rank/m_NX>0 && m_mpiInfo->rank/m_NX<m_NY-1)      if (m_mpiInfo->rank/d0>0 && m_mpiInfo->rank/d0<d1-1)
141          m_NE1++;          m_NE[1]++;
142      else if (m_NY>1 && m_mpiInfo->rank/m_NX==m_NY-1)      else if (d1>1 && m_mpiInfo->rank/d0==d1-1)
143          m_ownNE1--;          m_ownNE[1]--;
144    
145      // local number of nodes      // local number of nodes
146      m_N0 = m_NE0+1;      m_NN[0] = m_NE[0]+1;
147      m_N1 = m_NE1+1;      m_NN[1] = m_NE[1]+1;
148    
149      // bottom-left node is at (offset0,offset1) in global mesh      // bottom-left node is at (offset0,offset1) in global mesh
150      m_offset0 = (n0+1)/m_NX*(m_mpiInfo->rank%m_NX);      m_offset[0] = (n0+1)/d0*(m_mpiInfo->rank%d0);
151      if (m_offset0 > 0)      if (m_offset[0] > 0)
152          m_offset0--;          m_offset[0]--;
153      m_offset1 = (n1+1)/m_NY*(m_mpiInfo->rank/m_NX);      m_offset[1] = (n1+1)/d1*(m_mpiInfo->rank/d0);
154      if (m_offset1 > 0)      if (m_offset[1] > 0)
155          m_offset1--;          m_offset[1]--;
156    
157      populateSampleIds();      populateSampleIds();
158      createPattern();      createPattern();
159        assembler = new DefaultAssembler2D(this, m_dx, m_NX, m_NE, m_NN);
160        for (map<string, int>::const_iterator i = tagnamestonums.begin();
161                i != tagnamestonums.end(); i++) {
162            setTagMap(i->first, i->second);
163        }
164        addPoints(tags.size(), &points[0], &tags[0]);
165  }  }
166    
167  Rectangle::~Rectangle()  Rectangle::~Rectangle()
168  {  {
169      Paso_SystemMatrixPattern_free(m_pattern);      Paso_SystemMatrixPattern_free(m_pattern);
170      Paso_Connector_free(m_connector);      Paso_Connector_free(m_connector);
171        delete assembler;
172  }  }
173    
174  string Rectangle::getDescription() const  string Rectangle::getDescription() const
# Line 97  bool Rectangle::operator==(const Abstrac Line 181  bool Rectangle::operator==(const Abstrac
181      const Rectangle* o=dynamic_cast<const Rectangle*>(&other);      const Rectangle* o=dynamic_cast<const Rectangle*>(&other);
182      if (o) {      if (o) {
183          return (RipleyDomain::operator==(other) &&          return (RipleyDomain::operator==(other) &&
184                  m_gNE0==o->m_gNE0 && m_gNE1==o->m_gNE1                  m_gNE[0]==o->m_gNE[0] && m_gNE[1]==o->m_gNE[1]
185                  && m_x0==o->m_x0 && m_y0==o->m_y0                  && m_origin[0]==o->m_origin[0] && m_origin[1]==o->m_origin[1]
186                  && m_l0==o->m_l0 && m_l1==o->m_l1                  && m_length[0]==o->m_length[0] && m_length[1]==o->m_length[1]
187                  && m_NX==o->m_NX && m_NY==o->m_NY);                  && m_NX[0]==o->m_NX[0] && m_NX[1]==o->m_NX[1]);
188      }      }
189    
190      return false;      return false;
191  }  }
192    
193    void Rectangle::readNcGrid(escript::Data& out, string filename, string varname,
194                const ReaderParameters& params) const
195    {
196    #ifdef USE_NETCDF
197        // check destination function space
198        int myN0, myN1;
199        if (out.getFunctionSpace().getTypeCode() == Nodes) {
200            myN0 = m_NN[0];
201            myN1 = m_NN[1];
202        } else if (out.getFunctionSpace().getTypeCode() == Elements ||
203                    out.getFunctionSpace().getTypeCode() == ReducedElements) {
204            myN0 = m_NE[0];
205            myN1 = m_NE[1];
206        } else
207            throw RipleyException("readNcGrid(): invalid function space for output data object");
208    
209        if (params.first.size() != 2)
210            throw RipleyException("readNcGrid(): argument 'first' must have 2 entries");
211    
212        if (params.numValues.size() != 2)
213            throw RipleyException("readNcGrid(): argument 'numValues' must have 2 entries");
214    
215        if (params.multiplier.size() != 2)
216            throw RipleyException("readNcGrid(): argument 'multiplier' must have 2 entries");
217        for (size_t i=0; i<params.multiplier.size(); i++)
218            if (params.multiplier[i]<1)
219                throw RipleyException("readNcGrid(): all multipliers must be positive");
220        if (params.reverse.size() != 2)
221            throw RipleyException("readNcGrid(): argument 'reverse' must have 2 entries");
222    
223        // check file existence and size
224        NcFile f(filename.c_str(), NcFile::ReadOnly);
225        if (!f.is_valid())
226            throw RipleyException("readNcGrid(): cannot open file");
227    
228        NcVar* var = f.get_var(varname.c_str());
229        if (!var)
230            throw RipleyException("readNcGrid(): invalid variable");
231    
232        // TODO: rank>0 data support
233        const int numComp = out.getDataPointSize();
234        if (numComp > 1)
235            throw RipleyException("readNcGrid(): only scalar data supported");
236    
237        const int dims = var->num_dims();
238        boost::scoped_array<long> edges(var->edges());
239    
240        // is this a slice of the data object (dims!=2)?
241        // note the expected ordering of edges (as in numpy: y,x)
242        if ( (dims==2 && (params.numValues[1] > edges[0] || params.numValues[0] > edges[1]))
243                || (dims==1 && params.numValues[1]>1) ) {
244            throw RipleyException("readNcGrid(): not enough data in file");
245        }
246    
247        // check if this rank contributes anything
248        if (params.first[0] >= m_offset[0]+myN0 ||
249                params.first[0]+params.numValues[0]*params.multiplier[0] <= m_offset[0] ||
250                params.first[1] >= m_offset[1]+myN1 ||
251                params.first[1]+params.numValues[1]*params.multiplier[1] <= m_offset[1])
252            return;
253    
254        // now determine how much this rank has to write
255    
256        // first coordinates in data object to write to
257        const int first0 = max(0, params.first[0]-m_offset[0]);
258        const int first1 = max(0, params.first[1]-m_offset[1]);
259        // indices to first value in file (not accounting for reverse yet)
260        int idx0 = max(0, m_offset[0]-params.first[0]);
261        int idx1 = max(0, m_offset[1]-params.first[1]);
262        // number of values to read
263        const int num0 = min(params.numValues[0]-idx0, myN0-first0);
264        const int num1 = min(params.numValues[1]-idx1, myN1-first1);
265    
266        // make sure we read the right block if going backwards through file
267        if (params.reverse[0])
268            idx0 = edges[dims-1]-num0-idx0;
269        if (dims>1 && params.reverse[1])
270            idx1 = edges[dims-2]-num1-idx1;
271    
272        vector<double> values(num0*num1);
273        if (dims==2) {
274            var->set_cur(idx1, idx0);
275            var->get(&values[0], num1, num0);
276        } else {
277            var->set_cur(idx0);
278            var->get(&values[0], num0);
279        }
280    
281        const int dpp = out.getNumDataPointsPerSample();
282        out.requireWrite();
283    
284        // helpers for reversing
285        const int x0 = (params.reverse[0] ? num0-1 : 0);
286        const int x_mult = (params.reverse[0] ? -1 : 1);
287        const int y0 = (params.reverse[1] ? num1-1 : 0);
288        const int y_mult = (params.reverse[1] ? -1 : 1);
289    
290        for (index_t y=0; y<num1; y++) {
291    #pragma omp parallel for
292            for (index_t x=0; x<num0; x++) {
293                const int baseIndex = first0+x*params.multiplier[0]
294                                      +(first1+y*params.multiplier[1])*myN0;
295                const int srcIndex = (y0+y_mult*y)*num0+(x0+x_mult*x);
296                if (!isnan(values[srcIndex])) {
297                    for (index_t m1=0; m1<params.multiplier[1]; m1++) {
298                        for (index_t m0=0; m0<params.multiplier[0]; m0++) {
299                            const int dataIndex = baseIndex+m0+m1*myN0;
300                            double* dest = out.getSampleDataRW(dataIndex);
301                            for (index_t q=0; q<dpp; q++) {
302                                *dest++ = values[srcIndex];
303                            }
304                        }
305                    }
306                }
307            }
308        }
309    #else
310        throw RipleyException("readNcGrid(): not compiled with netCDF support");
311    #endif
312    }
313    
314    void Rectangle::readBinaryGrid(escript::Data& out, string filename,
315                                   const ReaderParameters& params) const
316    {
317        // the mapping is not universally correct but should work on our
318        // supported platforms
319        switch (params.dataType) {
320            case DATATYPE_INT32:
321                readBinaryGridImpl<int>(out, filename, params);
322                break;
323            case DATATYPE_FLOAT32:
324                readBinaryGridImpl<float>(out, filename, params);
325                break;
326            case DATATYPE_FLOAT64:
327                readBinaryGridImpl<double>(out, filename, params);
328                break;
329            default:
330                throw RipleyException("readBinaryGrid(): invalid or unsupported datatype");
331        }
332    }
333    
334    template<typename ValueType>
335    void Rectangle::readBinaryGridImpl(escript::Data& out, const string& filename,
336                                       const ReaderParameters& params) const
337    {
338        // check destination function space
339        int myN0, myN1;
340        if (out.getFunctionSpace().getTypeCode() == Nodes) {
341            myN0 = m_NN[0];
342            myN1 = m_NN[1];
343        } else if (out.getFunctionSpace().getTypeCode() == Elements ||
344                    out.getFunctionSpace().getTypeCode() == ReducedElements) {
345            myN0 = m_NE[0];
346            myN1 = m_NE[1];
347        } else
348            throw RipleyException("readBinaryGrid(): invalid function space for output data object");
349    
350        // check file existence and size
351        ifstream f(filename.c_str(), ifstream::binary);
352        if (f.fail()) {
353            throw RipleyException("readBinaryGrid(): cannot open file");
354        }
355        f.seekg(0, ios::end);
356        const int numComp = out.getDataPointSize();
357        const int filesize = f.tellg();
358        const int reqsize = params.numValues[0]*params.numValues[1]*numComp*sizeof(ValueType);
359        if (filesize < reqsize) {
360            f.close();
361            throw RipleyException("readBinaryGrid(): not enough data in file");
362        }
363    
364        // check if this rank contributes anything
365        if (params.first[0] >= m_offset[0]+myN0 ||
366                params.first[0]+params.numValues[0] <= m_offset[0] ||
367                params.first[1] >= m_offset[1]+myN1 ||
368                params.first[1]+params.numValues[1] <= m_offset[1]) {
369            f.close();
370            return;
371        }
372    
373        // now determine how much this rank has to write
374    
375        // first coordinates in data object to write to
376        const int first0 = max(0, params.first[0]-m_offset[0]);
377        const int first1 = max(0, params.first[1]-m_offset[1]);
378        // indices to first value in file
379        const int idx0 = max(0, m_offset[0]-params.first[0]);
380        const int idx1 = max(0, m_offset[1]-params.first[1]);
381        // number of values to read
382        const int num0 = min(params.numValues[0]-idx0, myN0-first0);
383        const int num1 = min(params.numValues[1]-idx1, myN1-first1);
384    
385        out.requireWrite();
386        vector<ValueType> values(num0*numComp);
387        const int dpp = out.getNumDataPointsPerSample();
388    
389        for (int y=0; y<num1; y++) {
390            const int fileofs = numComp*(idx0+(idx1+y)*params.numValues[0]);
391            f.seekg(fileofs*sizeof(ValueType));
392            f.read((char*)&values[0], num0*numComp*sizeof(ValueType));
393            for (int x=0; x<num0; x++) {
394                const int baseIndex = first0+x*params.multiplier[0]
395                                        +(first1+y*params.multiplier[1])*myN0;
396                for (int m1=0; m1<params.multiplier[1]; m1++) {
397                    for (int m0=0; m0<params.multiplier[0]; m0++) {
398                        const int dataIndex = baseIndex+m0+m1*myN0;
399                        double* dest = out.getSampleDataRW(dataIndex);
400                        for (int c=0; c<numComp; c++) {
401                            ValueType val = values[x*numComp+c];
402    
403                            if (params.byteOrder != BYTEORDER_NATIVE) {
404                                char* cval = reinterpret_cast<char*>(&val);
405                                // this will alter val!!
406                                byte_swap32(cval);
407                            }
408                            if (!std::isnan(val)) {
409                                for (int q=0; q<dpp; q++) {
410                                    *dest++ = static_cast<double>(val);
411                                }
412                            }
413                        }
414                    }
415                }
416            }
417        }
418    
419        f.close();
420    }
421    
422    void Rectangle::writeBinaryGrid(const escript::Data& in, string filename,
423                                    int byteOrder, int dataType) const
424    {
425        // the mapping is not universally correct but should work on our
426        // supported platforms
427        switch (dataType) {
428            case DATATYPE_INT32:
429                writeBinaryGridImpl<int>(in, filename, byteOrder);
430                break;
431            case DATATYPE_FLOAT32:
432                writeBinaryGridImpl<float>(in, filename, byteOrder);
433                break;
434            case DATATYPE_FLOAT64:
435                writeBinaryGridImpl<double>(in, filename, byteOrder);
436                break;
437            default:
438                throw RipleyException("writeBinaryGrid(): invalid or unsupported datatype");
439        }
440    }
441    
442    template<typename ValueType>
443    void Rectangle::writeBinaryGridImpl(const escript::Data& in,
444                                        const string& filename, int byteOrder) const
445    {
446        // check function space and determine number of points
447        int myN0, myN1;
448        int totalN0, totalN1;
449        if (in.getFunctionSpace().getTypeCode() == Nodes) {
450            myN0 = m_NN[0];
451            myN1 = m_NN[1];
452            totalN0 = m_gNE[0]+1;
453            totalN1 = m_gNE[1]+1;
454        } else if (in.getFunctionSpace().getTypeCode() == Elements ||
455                    in.getFunctionSpace().getTypeCode() == ReducedElements) {
456            myN0 = m_NE[0];
457            myN1 = m_NE[1];
458            totalN0 = m_gNE[0];
459            totalN1 = m_gNE[1];
460        } else
461            throw RipleyException("writeBinaryGrid(): invalid function space of data object");
462    
463        const int numComp = in.getDataPointSize();
464        const int dpp = in.getNumDataPointsPerSample();
465    
466        if (numComp > 1 || dpp > 1)
467            throw RipleyException("writeBinaryGrid(): only scalar, single-value data supported");
468    
469        const int fileSize = sizeof(ValueType)*numComp*dpp*totalN0*totalN1;
470    
471        // from here on we know that each sample consists of one value
472        FileWriter fw;
473        fw.openFile(filename, fileSize);
474        MPIBarrier();
475    
476        for (index_t y=0; y<myN1; y++) {
477            const int fileofs = (m_offset[0]+(m_offset[1]+y)*totalN0)*sizeof(ValueType);
478            ostringstream oss;
479    
480            for (index_t x=0; x<myN0; x++) {
481                const double* sample = in.getSampleDataRO(y*myN0+x);
482                ValueType fvalue = static_cast<ValueType>(*sample);
483                if (byteOrder == BYTEORDER_NATIVE) {
484                    oss.write((char*)&fvalue, sizeof(fvalue));
485                } else {
486                    char* value = reinterpret_cast<char*>(&fvalue);
487                    oss.write(byte_swap32(value), sizeof(fvalue));
488                }
489            }
490            fw.writeAt(oss, fileofs);
491        }
492        fw.close();
493    }
494    
495  void Rectangle::dump(const string& fileName) const  void Rectangle::dump(const string& fileName) const
496  {  {
497  #if USE_SILO  #if USE_SILO
# Line 114  void Rectangle::dump(const string& fileN Line 500  void Rectangle::dump(const string& fileN
500          fn+=".silo";          fn+=".silo";
501      }      }
502    
     const int NUM_SILO_FILES = 1;  
     const char* blockDirFmt = "/block%04d";  
503      int driver=DB_HDF5;          int driver=DB_HDF5;    
504      DBfile* dbfile = NULL;      DBfile* dbfile = NULL;
505        const char* blockDirFmt = "/block%04d";
506    
507  #ifdef ESYS_MPI  #ifdef ESYS_MPI
508      PMPIO_baton_t* baton = NULL;      PMPIO_baton_t* baton = NULL;
509        const int NUM_SILO_FILES = 1;
510  #endif  #endif
511    
512      if (m_mpiInfo->size > 1) {      if (m_mpiInfo->size > 1) {
# Line 168  void Rectangle::dump(const string& fileN Line 554  void Rectangle::dump(const string& fileN
554      }      }
555      */      */
556    
557      boost::scoped_ptr<double> x(new double[m_N0]);      boost::scoped_ptr<double> x(new double[m_NN[0]]);
558      boost::scoped_ptr<double> y(new double[m_N1]);      boost::scoped_ptr<double> y(new double[m_NN[1]]);
559      double* coords[2] = { x.get(), y.get() };      double* coords[2] = { x.get(), y.get() };
     pair<double,double> xdx = getFirstCoordAndSpacing(0);  
     pair<double,double> ydy = getFirstCoordAndSpacing(1);  
560  #pragma omp parallel  #pragma omp parallel
561      {      {
562  #pragma omp for nowait  #pragma omp for nowait
563          for (dim_t i0 = 0; i0 < m_N0; i0++) {          for (dim_t i0 = 0; i0 < m_NN[0]; i0++) {
564              coords[0][i0]=xdx.first+i0*xdx.second;              coords[0][i0]=getLocalCoordinate(i0, 0);
565          }          }
566  #pragma omp for nowait  #pragma omp for nowait
567          for (dim_t i1 = 0; i1 < m_N1; i1++) {          for (dim_t i1 = 0; i1 < m_NN[1]; i1++) {
568              coords[1][i1]=ydy.first+i1*ydy.second;              coords[1][i1]=getLocalCoordinate(i1, 1);
569          }          }
570      }      }
571      IndexVector dims = getNumNodesPerDim();      int* dims = const_cast<int*>(getNumNodesPerDim());
572    
573      // write mesh      // write mesh
574      DBPutQuadmesh(dbfile, "mesh", NULL, coords, &dims[0], 2, DB_DOUBLE,      DBPutQuadmesh(dbfile, "mesh", NULL, coords, dims, 2, DB_DOUBLE,
575              DB_COLLINEAR, NULL);              DB_COLLINEAR, NULL);
576    
577      // write node ids      // write node ids
578      DBPutQuadvar1(dbfile, "nodeId", "mesh", (void*)&m_nodeId[0], &dims[0], 2,      DBPutQuadvar1(dbfile, "nodeId", "mesh", (void*)&m_nodeId[0], dims, 2,
579              NULL, 0, DB_INT, DB_NODECENT, NULL);              NULL, 0, DB_INT, DB_NODECENT, NULL);
580    
581      // write element ids      // write element ids
582      dims = getNumElementsPerDim();      dims = const_cast<int*>(getNumElementsPerDim());
583      DBPutQuadvar1(dbfile, "elementId", "mesh", (void*)&m_elementId[0],      DBPutQuadvar1(dbfile, "elementId", "mesh", (void*)&m_elementId[0],
584              &dims[0], 2, NULL, 0, DB_INT, DB_ZONECENT, NULL);              dims, 2, NULL, 0, DB_INT, DB_ZONECENT, NULL);
585    
586      // rank 0 writes multimesh and multivar      // rank 0 writes multimesh and multivar
587      if (m_mpiInfo->rank == 0) {      if (m_mpiInfo->rank == 0) {
# Line 265  const int* Rectangle::borrowSampleRefere Line 649  const int* Rectangle::borrowSampleRefere
649          case FaceElements:          case FaceElements:
650          case ReducedFaceElements:          case ReducedFaceElements:
651              return &m_faceId[0];              return &m_faceId[0];
652            case Points:
653                return &m_diracPointNodeIDs[0];
654          default:          default:
655              break;              break;
656      }      }
# Line 289  bool Rectangle::ownSample(int fsType, in Line 675  bool Rectangle::ownSample(int fsType, in
675          case Elements:          case Elements:
676          case ReducedElements:          case ReducedElements:
677              // check ownership of element's bottom left node              // check ownership of element's bottom left node
678              return (m_dofMap[id%m_NE0+m_N0*(id/m_NE0)] < getNumDOF());              return (m_dofMap[id%m_NE[0]+m_NN[0]*(id/m_NE[0])] < getNumDOF());
679          case FaceElements:          case FaceElements:
680          case ReducedFaceElements:          case ReducedFaceElements:
681              {              {
682                  // determine which face the sample belongs to before                  // determine which face the sample belongs to before
683                  // checking ownership of corresponding element's first node                  // checking ownership of corresponding element's first node
                 const IndexVector faces = getNumFacesPerBoundary();  
684                  dim_t n=0;                  dim_t n=0;
685                  for (size_t i=0; i<faces.size(); i++) {                  for (size_t i=0; i<4; i++) {
686                      n+=faces[i];                      n+=m_faceCount[i];
687                      if (id<n) {                      if (id<n) {
688                          index_t k;                          index_t k;
689                          if (i==1)                          if (i==1)
690                              k=m_N0-2;                              k=m_NN[0]-2;
691                          else if (i==3)                          else if (i==3)
692                              k=m_N0*(m_N1-2);                              k=m_NN[0]*(m_NN[1]-2);
693                          else                          else
694                              k=0;                              k=0;
695                          // determine whether to move right or up                          // determine whether to move right or up
696                          const index_t delta=(i/2==0 ? m_N0 : 1);                          const index_t delta=(i/2==0 ? m_NN[0] : 1);
697                          return (m_dofMap[k+(id-n+faces[i])*delta] < getNumDOF());                          return (m_dofMap[k+(id-n+m_faceCount[i])*delta] < getNumDOF());
698                      }                      }
699                  }                  }
700                  return false;                  return false;
# Line 331  void Rectangle::setToNormal(escript::Dat Line 716  void Rectangle::setToNormal(escript::Dat
716          {          {
717              if (m_faceOffset[0] > -1) {              if (m_faceOffset[0] > -1) {
718  #pragma omp for nowait  #pragma omp for nowait
719                  for (index_t k1 = 0; k1 < m_NE1; ++k1) {                  for (index_t k1 = 0; k1 < m_NE[1]; ++k1) {
720                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);
721                      // set vector at two quadrature points                      // set vector at two quadrature points
722                      *o++ = -1.;                      *o++ = -1.;
# Line 343  void Rectangle::setToNormal(escript::Dat Line 728  void Rectangle::setToNormal(escript::Dat
728    
729              if (m_faceOffset[1] > -1) {              if (m_faceOffset[1] > -1) {
730  #pragma omp for nowait  #pragma omp for nowait
731                  for (index_t k1 = 0; k1 < m_NE1; ++k1) {                  for (index_t k1 = 0; k1 < m_NE[1]; ++k1) {
732                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);
733                      // set vector at two quadrature points                      // set vector at two quadrature points
734                      *o++ = 1.;                      *o++ = 1.;
# Line 355  void Rectangle::setToNormal(escript::Dat Line 740  void Rectangle::setToNormal(escript::Dat
740    
741              if (m_faceOffset[2] > -1) {              if (m_faceOffset[2] > -1) {
742  #pragma omp for nowait  #pragma omp for nowait
743                  for (index_t k0 = 0; k0 < m_NE0; ++k0) {                  for (index_t k0 = 0; k0 < m_NE[0]; ++k0) {
744                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);
745                      // set vector at two quadrature points                      // set vector at two quadrature points
746                      *o++ = 0.;                      *o++ = 0.;
# Line 367  void Rectangle::setToNormal(escript::Dat Line 752  void Rectangle::setToNormal(escript::Dat
752    
753              if (m_faceOffset[3] > -1) {              if (m_faceOffset[3] > -1) {
754  #pragma omp for nowait  #pragma omp for nowait
755                  for (index_t k0 = 0; k0 < m_NE0; ++k0) {                  for (index_t k0 = 0; k0 < m_NE[0]; ++k0) {
756                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);
757                      // set vector at two quadrature points                      // set vector at two quadrature points
758                      *o++ = 0.;                      *o++ = 0.;
# Line 383  void Rectangle::setToNormal(escript::Dat Line 768  void Rectangle::setToNormal(escript::Dat
768          {          {
769              if (m_faceOffset[0] > -1) {              if (m_faceOffset[0] > -1) {
770  #pragma omp for nowait  #pragma omp for nowait
771                  for (index_t k1 = 0; k1 < m_NE1; ++k1) {                  for (index_t k1 = 0; k1 < m_NE[1]; ++k1) {
772                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);
773                      *o++ = -1.;                      *o++ = -1.;
774                      *o = 0.;                      *o = 0.;
# Line 392  void Rectangle::setToNormal(escript::Dat Line 777  void Rectangle::setToNormal(escript::Dat
777    
778              if (m_faceOffset[1] > -1) {              if (m_faceOffset[1] > -1) {
779  #pragma omp for nowait  #pragma omp for nowait
780                  for (index_t k1 = 0; k1 < m_NE1; ++k1) {                  for (index_t k1 = 0; k1 < m_NE[1]; ++k1) {
781                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);
782                      *o++ = 1.;                      *o++ = 1.;
783                      *o = 0.;                      *o = 0.;
# Line 401  void Rectangle::setToNormal(escript::Dat Line 786  void Rectangle::setToNormal(escript::Dat
786    
787              if (m_faceOffset[2] > -1) {              if (m_faceOffset[2] > -1) {
788  #pragma omp for nowait  #pragma omp for nowait
789                  for (index_t k0 = 0; k0 < m_NE0; ++k0) {                  for (index_t k0 = 0; k0 < m_NE[0]; ++k0) {
790                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);
791                      *o++ = 0.;                      *o++ = 0.;
792                      *o = -1.;                      *o = -1.;
# Line 410  void Rectangle::setToNormal(escript::Dat Line 795  void Rectangle::setToNormal(escript::Dat
795    
796              if (m_faceOffset[3] > -1) {              if (m_faceOffset[3] > -1) {
797  #pragma omp for nowait  #pragma omp for nowait
798                  for (index_t k0 = 0; k0 < m_NE0; ++k0) {                  for (index_t k0 = 0; k0 < m_NE[0]; ++k0) {
799                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);
800                      *o++ = 0.;                      *o++ = 0.;
801                      *o = 1.;                      *o = 1.;
# Line 432  void Rectangle::setToSize(escript::Data& Line 817  void Rectangle::setToSize(escript::Data&
817              || out.getFunctionSpace().getTypeCode() == ReducedElements) {              || out.getFunctionSpace().getTypeCode() == ReducedElements) {
818          out.requireWrite();          out.requireWrite();
819          const dim_t numQuad=out.getNumDataPointsPerSample();          const dim_t numQuad=out.getNumDataPointsPerSample();
820          const double hSize=getFirstCoordAndSpacing(0).second;          const double size=sqrt(m_dx[0]*m_dx[0]+m_dx[1]*m_dx[1]);
         const double vSize=getFirstCoordAndSpacing(1).second;  
         const double size=min(hSize,vSize);  
821  #pragma omp parallel for  #pragma omp parallel for
822          for (index_t k = 0; k < getNumElements(); ++k) {          for (index_t k = 0; k < getNumElements(); ++k) {
823              double* o = out.getSampleDataRW(k);              double* o = out.getSampleDataRW(k);
# Line 444  void Rectangle::setToSize(escript::Data& Line 827  void Rectangle::setToSize(escript::Data&
827              || out.getFunctionSpace().getTypeCode() == ReducedFaceElements) {              || out.getFunctionSpace().getTypeCode() == ReducedFaceElements) {
828          out.requireWrite();          out.requireWrite();
829          const dim_t numQuad=out.getNumDataPointsPerSample();          const dim_t numQuad=out.getNumDataPointsPerSample();
         const double hSize=getFirstCoordAndSpacing(0).second;  
         const double vSize=getFirstCoordAndSpacing(1).second;  
830  #pragma omp parallel  #pragma omp parallel
831          {          {
832              if (m_faceOffset[0] > -1) {              if (m_faceOffset[0] > -1) {
833  #pragma omp for nowait  #pragma omp for nowait
834                  for (index_t k1 = 0; k1 < m_NE1; ++k1) {                  for (index_t k1 = 0; k1 < m_NE[1]; ++k1) {
835                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);
836                      fill(o, o+numQuad, vSize);                      fill(o, o+numQuad, m_dx[1]);
837                  }                  }
838              }              }
839    
840              if (m_faceOffset[1] > -1) {              if (m_faceOffset[1] > -1) {
841  #pragma omp for nowait  #pragma omp for nowait
842                  for (index_t k1 = 0; k1 < m_NE1; ++k1) {                  for (index_t k1 = 0; k1 < m_NE[1]; ++k1) {
843                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);
844                      fill(o, o+numQuad, vSize);                      fill(o, o+numQuad, m_dx[1]);
845                  }                  }
846              }              }
847    
848              if (m_faceOffset[2] > -1) {              if (m_faceOffset[2] > -1) {
849  #pragma omp for nowait  #pragma omp for nowait
850                  for (index_t k0 = 0; k0 < m_NE0; ++k0) {                  for (index_t k0 = 0; k0 < m_NE[0]; ++k0) {
851                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);
852                      fill(o, o+numQuad, hSize);                      fill(o, o+numQuad, m_dx[0]);
853                  }                  }
854              }              }
855    
856              if (m_faceOffset[3] > -1) {              if (m_faceOffset[3] > -1) {
857  #pragma omp for nowait  #pragma omp for nowait
858                  for (index_t k0 = 0; k0 < m_NE0; ++k0) {                  for (index_t k0 = 0; k0 < m_NE[0]; ++k0) {
859                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);
860                      fill(o, o+numQuad, hSize);                      fill(o, o+numQuad, m_dx[0]);
861                  }                  }
862              }              }
863          } // end of parallel section          } // end of parallel section
# Line 489  void Rectangle::setToSize(escript::Data& Line 870  void Rectangle::setToSize(escript::Data&
870      }      }
871  }  }
872    
 Paso_SystemMatrixPattern* Rectangle::getPattern(bool reducedRowOrder,  
                                                 bool reducedColOrder) const  
 {  
     /* FIXME: reduced  
     if (reducedRowOrder || reducedColOrder)  
         throw RipleyException("getPattern() not implemented for reduced order");  
     */  
     return m_pattern;  
 }  
   
873  void Rectangle::Print_Mesh_Info(const bool full) const  void Rectangle::Print_Mesh_Info(const bool full) const
874  {  {
875      RipleyDomain::Print_Mesh_Info(full);      RipleyDomain::Print_Mesh_Info(full);
# Line 506  void Rectangle::Print_Mesh_Info(const bo Line 877  void Rectangle::Print_Mesh_Info(const bo
877          cout << "     Id  Coordinates" << endl;          cout << "     Id  Coordinates" << endl;
878          cout.precision(15);          cout.precision(15);
879          cout.setf(ios::scientific, ios::floatfield);          cout.setf(ios::scientific, ios::floatfield);
         pair<double,double> xdx = getFirstCoordAndSpacing(0);  
         pair<double,double> ydy = getFirstCoordAndSpacing(1);  
880          for (index_t i=0; i < getNumNodes(); i++) {          for (index_t i=0; i < getNumNodes(); i++) {
881              cout << "  " << setw(5) << m_nodeId[i]              cout << "  " << setw(5) << m_nodeId[i]
882                  << "  " << xdx.first+(i%m_N0)*xdx.second                  << "  " << getLocalCoordinate(i%m_NN[0], 0)
883                  << "  " << ydy.first+(i/m_N0)*ydy.second << endl;                  << "  " << getLocalCoordinate(i/m_NN[0], 1) << endl;
884          }          }
885      }      }
886  }  }
887    
 IndexVector Rectangle::getNumNodesPerDim() const  
 {  
     IndexVector ret;  
     ret.push_back(m_N0);  
     ret.push_back(m_N1);  
     return ret;  
 }  
   
 IndexVector Rectangle::getNumElementsPerDim() const  
 {  
     IndexVector ret;  
     ret.push_back(m_NE0);  
     ret.push_back(m_NE1);  
     return ret;  
 }  
   
 IndexVector Rectangle::getNumFacesPerBoundary() const  
 {  
     IndexVector ret(4, 0);  
     //left  
     if (m_offset0==0)  
         ret[0]=m_NE1;  
     //right  
     if (m_mpiInfo->rank%m_NX==m_NX-1)  
         ret[1]=m_NE1;  
     //bottom  
     if (m_offset1==0)  
         ret[2]=m_NE0;  
     //top  
     if (m_mpiInfo->rank/m_NX==m_NY-1)  
         ret[3]=m_NE0;  
     return ret;  
 }  
   
 IndexVector Rectangle::getNumSubdivisionsPerDim() const  
 {  
     IndexVector ret;  
     ret.push_back(m_NX);  
     ret.push_back(m_NY);  
     return ret;  
 }  
   
 pair<double,double> Rectangle::getFirstCoordAndSpacing(dim_t dim) const  
 {  
     if (dim==0) {  
         return pair<double,double>(m_x0+(m_l0*m_offset0)/m_gNE0, m_l0/m_gNE0);  
     } else if (dim==1) {  
         return pair<double,double>(m_y0+(m_l1*m_offset1)/m_gNE1, m_l1/m_gNE1);  
     }  
     throw RipleyException("getFirstCoordAndSpacing: invalid argument");  
 }  
   
 //protected  
 dim_t Rectangle::getNumDOF() const  
 {  
     return (m_gNE0+1)/m_NX*(m_gNE1+1)/m_NY;  
 }  
   
 //protected  
 dim_t Rectangle::getNumFaceElements() const  
 {  
     const IndexVector faces = getNumFacesPerBoundary();  
     dim_t n=0;  
     for (size_t i=0; i<faces.size(); i++)  
         n+=faces[i];  
     return n;  
 }  
888    
889  //protected  //protected
890  void Rectangle::assembleCoordinates(escript::Data& arg) const  void Rectangle::assembleCoordinates(escript::Data& arg) const
# Line 594  void Rectangle::assembleCoordinates(escr Line 896  void Rectangle::assembleCoordinates(escr
896      if (!numSamplesEqual(&x, 1, getNumNodes()))      if (!numSamplesEqual(&x, 1, getNumNodes()))
897          throw RipleyException("setToX: Illegal number of samples in Data object");          throw RipleyException("setToX: Illegal number of samples in Data object");
898    
     pair<double,double> xdx = getFirstCoordAndSpacing(0);  
     pair<double,double> ydy = getFirstCoordAndSpacing(1);  
899      arg.requireWrite();      arg.requireWrite();
900  #pragma omp parallel for  #pragma omp parallel for
901      for (dim_t i1 = 0; i1 < m_N1; i1++) {      for (dim_t i1 = 0; i1 < m_NN[1]; i1++) {
902          for (dim_t i0 = 0; i0 < m_N0; i0++) {          for (dim_t i0 = 0; i0 < m_NN[0]; i0++) {
903              double* point = arg.getSampleDataRW(i0+m_N0*i1);              double* point = arg.getSampleDataRW(i0+m_NN[0]*i1);
904              point[0] = xdx.first+i0*xdx.second;              point[0] = getLocalCoordinate(i0, 0);
905              point[1] = ydy.first+i1*ydy.second;              point[1] = getLocalCoordinate(i1, 1);
906          }          }
907      }      }
908  }  }
909    
910  //protected  //protected
911  void Rectangle::assembleGradient(escript::Data& out, escript::Data& in) const  void Rectangle::assembleGradient(escript::Data& out, const escript::Data& in) const
912  {  {
913      const dim_t numComp = in.getDataPointSize();      const dim_t numComp = in.getDataPointSize();
914      const double h0 = m_l0/m_gNE0;      const double cx0 = .21132486540518711775/m_dx[0];
915      const double h1 = m_l1/m_gNE1;      const double cx1 = .78867513459481288225/m_dx[0];
916      const double cx0 = -1./h0;      const double cx2 = 1./m_dx[0];
917      const double cx1 = -.78867513459481288225/h0;      const double cy0 = .21132486540518711775/m_dx[1];
918      const double cx2 = -.5/h0;      const double cy1 = .78867513459481288225/m_dx[1];
919      const double cx3 = -.21132486540518711775/h0;      const double cy2 = 1./m_dx[1];
     const double cx4 = .21132486540518711775/h0;  
     const double cx5 = .5/h0;  
     const double cx6 = .78867513459481288225/h0;  
     const double cx7 = 1./h0;  
     const double cy0 = -1./h1;  
     const double cy1 = -.78867513459481288225/h1;  
     const double cy2 = -.5/h1;  
     const double cy3 = -.21132486540518711775/h1;  
     const double cy4 = .21132486540518711775/h1;  
     const double cy5 = .5/h1;  
     const double cy6 = .78867513459481288225/h1;  
     const double cy7 = 1./h1;  
920    
921      if (out.getFunctionSpace().getTypeCode() == Elements) {      if (out.getFunctionSpace().getTypeCode() == Elements) {
922          out.requireWrite();          out.requireWrite();
923  #pragma omp parallel for  #pragma omp parallel
924          for (index_t k1=0; k1 < m_NE1; ++k1) {          {
925              for (index_t k0=0; k0 < m_NE0; ++k0) {              vector<double> f_00(numComp);
926                  const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,k1, m_N0));              vector<double> f_01(numComp);
927                  const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,k1+1, m_N0));              vector<double> f_10(numComp);
928                  const double* f_01 = in.getSampleDataRO(INDEX2(k0,k1+1, m_N0));              vector<double> f_11(numComp);
929                  const double* f_00 = in.getSampleDataRO(INDEX2(k0,k1, m_N0));  #pragma omp for
930                  double* o = out.getSampleDataRW(INDEX2(k0,k1,m_NE0));              for (index_t k1=0; k1 < m_NE[1]; ++k1) {
931                  for (index_t i=0; i < numComp; ++i) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
932                      o[INDEX3(i,0,0,numComp,2)] = f_00[i]*cx1 + f_01[i]*cx3 + f_10[i]*cx6 + f_11[i]*cx4;                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,k1, m_NN[0])), numComp*sizeof(double));
933                      o[INDEX3(i,1,0,numComp,2)] = f_00[i]*cy1 + f_01[i]*cy6 + f_10[i]*cy3 + f_11[i]*cy4;                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,k1+1, m_NN[0])), numComp*sizeof(double));
934                      o[INDEX3(i,0,1,numComp,2)] = f_00[i]*cx1 + f_01[i]*cx3 + f_10[i]*cx6 + f_11[i]*cx4;                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,k1, m_NN[0])), numComp*sizeof(double));
935                      o[INDEX3(i,1,1,numComp,2)] = f_00[i]*cy3 + f_01[i]*cy4 + f_10[i]*cy1 + f_11[i]*cy6;                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,k1+1, m_NN[0])), numComp*sizeof(double));
936                      o[INDEX3(i,0,2,numComp,2)] = f_00[i]*cx3 + f_01[i]*cx1 + f_10[i]*cx4 + f_11[i]*cx6;                      double* o = out.getSampleDataRW(INDEX2(k0,k1,m_NE[0]));
937                      o[INDEX3(i,1,2,numComp,2)] = f_00[i]*cy1 + f_01[i]*cy6 + f_10[i]*cy3 + f_11[i]*cy4;                      for (index_t i=0; i < numComp; ++i) {
938                      o[INDEX3(i,0,3,numComp,2)] = f_00[i]*cx3 + f_01[i]*cx1 + f_10[i]*cx4 + f_11[i]*cx6;                          o[INDEX3(i,0,0,numComp,2)] = (f_10[i]-f_00[i])*cx1 + (f_11[i]-f_01[i])*cx0;
939                      o[INDEX3(i,1,3,numComp,2)] = f_00[i]*cy3 + f_01[i]*cy4 + f_10[i]*cy1 + f_11[i]*cy6;                          o[INDEX3(i,1,0,numComp,2)] = (f_01[i]-f_00[i])*cy1 + (f_11[i]-f_10[i])*cy0;
940                  } /* end of component loop i */                          o[INDEX3(i,0,1,numComp,2)] = (f_10[i]-f_00[i])*cx1 + (f_11[i]-f_01[i])*cx0;
941              } /* end of k0 loop */                          o[INDEX3(i,1,1,numComp,2)] = (f_01[i]-f_00[i])*cy0 + (f_11[i]-f_10[i])*cy1;
942          } /* end of k1 loop */                          o[INDEX3(i,0,2,numComp,2)] = (f_10[i]-f_00[i])*cx0 + (f_11[i]-f_01[i])*cx1;
943                            o[INDEX3(i,1,2,numComp,2)] = (f_01[i]-f_00[i])*cy1 + (f_11[i]-f_10[i])*cy0;
944                            o[INDEX3(i,0,3,numComp,2)] = (f_10[i]-f_00[i])*cx0 + (f_11[i]-f_01[i])*cx1;
945                            o[INDEX3(i,1,3,numComp,2)] = (f_01[i]-f_00[i])*cy0 + (f_11[i]-f_10[i])*cy1;
946                        } // end of component loop i
947                    } // end of k0 loop
948                } // end of k1 loop
949            } // end of parallel section
950      } else if (out.getFunctionSpace().getTypeCode() == ReducedElements) {      } else if (out.getFunctionSpace().getTypeCode() == ReducedElements) {
951          out.requireWrite();          out.requireWrite();
952  #pragma omp parallel for  #pragma omp parallel
953          for (index_t k1=0; k1 < m_NE1; ++k1) {          {
954              for (index_t k0=0; k0 < m_NE0; ++k0) {              vector<double> f_00(numComp);
955                  const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,k1, m_N0));              vector<double> f_01(numComp);
956                  const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,k1+1, m_N0));              vector<double> f_10(numComp);
957                  const double* f_01 = in.getSampleDataRO(INDEX2(k0,k1+1, m_N0));              vector<double> f_11(numComp);
958                  const double* f_00 = in.getSampleDataRO(INDEX2(k0,k1, m_N0));  #pragma omp for
959                  double* o = out.getSampleDataRW(INDEX2(k0,k1,m_NE0));              for (index_t k1=0; k1 < m_NE[1]; ++k1) {
960                  for (index_t i=0; i < numComp; ++i) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
961                      o[INDEX3(i,0,0,numComp,2)] = cx5*(f_10[i] + f_11[i]) + cx2*(f_00[i] + f_01[i]);                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,k1, m_NN[0])), numComp*sizeof(double));
962                      o[INDEX3(i,1,0,numComp,2)] = cy2*(f_00[i] + f_10[i]) + cy5*(f_01[i] + f_11[i]);                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,k1+1, m_NN[0])), numComp*sizeof(double));
963                  } /* end of component loop i */                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,k1, m_NN[0])), numComp*sizeof(double));
964              } /* end of k0 loop */                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,k1+1, m_NN[0])), numComp*sizeof(double));
965          } /* end of k1 loop */                      double* o = out.getSampleDataRW(INDEX2(k0,k1,m_NE[0]));
966                        for (index_t i=0; i < numComp; ++i) {
967                            o[INDEX3(i,0,0,numComp,2)] = (f_10[i] + f_11[i] - f_00[i] - f_01[i])*cx2/2;
968                            o[INDEX3(i,1,0,numComp,2)] = (f_01[i] + f_11[i] - f_00[i] - f_10[i])*cy2/2;
969                        } // end of component loop i
970                    } // end of k0 loop
971                } // end of k1 loop
972            } // end of parallel section
973      } else if (out.getFunctionSpace().getTypeCode() == FaceElements) {      } else if (out.getFunctionSpace().getTypeCode() == FaceElements) {
974          out.requireWrite();          out.requireWrite();
975  #pragma omp parallel  #pragma omp parallel
976          {          {
977                vector<double> f_00(numComp);
978                vector<double> f_01(numComp);
979                vector<double> f_10(numComp);
980                vector<double> f_11(numComp);
981              if (m_faceOffset[0] > -1) {              if (m_faceOffset[0] > -1) {
982  #pragma omp for nowait  #pragma omp for nowait
983                  for (index_t k1=0; k1 < m_NE1; ++k1) {                  for (index_t k1=0; k1 < m_NE[1]; ++k1) {
984                      const double* f_10 = in.getSampleDataRO(INDEX2(1,k1, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(0,k1, m_NN[0])), numComp*sizeof(double));
985                      const double* f_11 = in.getSampleDataRO(INDEX2(1,k1+1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(0,k1+1, m_NN[0])), numComp*sizeof(double));
986                      const double* f_01 = in.getSampleDataRO(INDEX2(0,k1+1, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(1,k1, m_NN[0])), numComp*sizeof(double));
987                      const double* f_00 = in.getSampleDataRO(INDEX2(0,k1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(1,k1+1, m_NN[0])), numComp*sizeof(double));
988                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);
989                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
990                          o[INDEX3(i,0,0,numComp,2)] = f_00[i]*cx1 + f_01[i]*cx3 + f_10[i]*cx6 + f_11[i]*cx4;                          o[INDEX3(i,0,0,numComp,2)] = (f_10[i]-f_00[i])*cx1 + (f_11[i]-f_01[i])*cx0;
991                          o[INDEX3(i,1,0,numComp,2)] = f_00[i]*cy0 + f_01[i]*cy7;                          o[INDEX3(i,1,0,numComp,2)] = (f_01[i]-f_00[i])*cy2;
992                          o[INDEX3(i,0,1,numComp,2)] = f_00[i]*cx3 + f_01[i]*cx1 + f_10[i]*cx4 + f_11[i]*cx6;                          o[INDEX3(i,0,1,numComp,2)] = (f_10[i]-f_00[i])*cx0 + (f_11[i]-f_01[i])*cx1;
993                          o[INDEX3(i,1,1,numComp,2)] = f_00[i]*cy0 + f_01[i]*cy7;                          o[INDEX3(i,1,1,numComp,2)] = (f_01[i]-f_00[i])*cy2;
994                      } /* end of component loop i */                      } // end of component loop i
995                  } /* end of k1 loop */                  } // end of k1 loop
996              } /* end of face 0 */              } // end of face 0
997              if (m_faceOffset[1] > -1) {              if (m_faceOffset[1] > -1) {
998  #pragma omp for nowait  #pragma omp for nowait
999                  for (index_t k1=0; k1 < m_NE1; ++k1) {                  for (index_t k1=0; k1 < m_NE[1]; ++k1) {
1000                      const double* f_10 = in.getSampleDataRO(INDEX2(m_N0-1,k1, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(m_NN[0]-2,k1, m_NN[0])), numComp*sizeof(double));
1001                      const double* f_11 = in.getSampleDataRO(INDEX2(m_N0-1,k1+1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(m_NN[0]-2,k1+1, m_NN[0])), numComp*sizeof(double));
1002                      const double* f_01 = in.getSampleDataRO(INDEX2(m_N0-2,k1+1, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(m_NN[0]-1,k1, m_NN[0])), numComp*sizeof(double));
1003                      const double* f_00 = in.getSampleDataRO(INDEX2(m_N0-2,k1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(m_NN[0]-1,k1+1, m_NN[0])), numComp*sizeof(double));
1004                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);
1005                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1006                          o[INDEX3(i,0,0,numComp,2)] = f_00[i]*cx1 + f_01[i]*cx3 + f_10[i]*cx6 + f_11[i]*cx4;                          o[INDEX3(i,0,0,numComp,2)] = (f_10[i]-f_00[i])*cx1 + (f_11[i]-f_01[i])*cx0;
1007                          o[INDEX3(i,1,0,numComp,2)] = f_10[i]*cy0 + f_11[i]*cy7;                          o[INDEX3(i,1,0,numComp,2)] = (f_11[i]-f_10[i])*cy2;
1008                          o[INDEX3(i,0,1,numComp,2)] = f_00[i]*cx3 + f_01[i]*cx1 + f_10[i]*cx4 + f_11[i]*cx6;                          o[INDEX3(i,0,1,numComp,2)] = (f_10[i]-f_00[i])*cx0 + (f_11[i]-f_01[i])*cx1;
1009                          o[INDEX3(i,1,1,numComp,2)] = f_10[i]*cy0 + f_11[i]*cy7;                          o[INDEX3(i,1,1,numComp,2)] = (f_11[i]-f_10[i])*cy2;
1010                      } /* end of component loop i */                      } // end of component loop i
1011                  } /* end of k1 loop */                  } // end of k1 loop
1012              } /* end of face 1 */              } // end of face 1
1013              if (m_faceOffset[2] > -1) {              if (m_faceOffset[2] > -1) {
1014  #pragma omp for nowait  #pragma omp for nowait
1015                  for (index_t k0=0; k0 < m_NE0; ++k0) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1016                      const double* f_00 = in.getSampleDataRO(INDEX2(k0,0, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,0, m_NN[0])), numComp*sizeof(double));
1017                      const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,0, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,1, m_NN[0])), numComp*sizeof(double));
1018                      const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,1, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,0, m_NN[0])), numComp*sizeof(double));
1019                      const double* f_01 = in.getSampleDataRO(INDEX2(k0,1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,1, m_NN[0])), numComp*sizeof(double));
1020                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);
1021                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1022                          o[INDEX3(i,0,0,numComp,2)] = f_00[i]*cx0 + f_10[i]*cx7;                          o[INDEX3(i,0,0,numComp,2)] = (f_10[i]-f_00[i])*cx2;
1023                          o[INDEX3(i,1,0,numComp,2)] = f_00[i]*cy1 + f_01[i]*cy6 + f_10[i]*cy3 + f_11[i]*cy4;                          o[INDEX3(i,1,0,numComp,2)] = (f_01[i]-f_00[i])*cy1 + (f_11[i]-f_10[i])*cy0;
1024                          o[INDEX3(i,0,1,numComp,2)] = f_00[i]*cx0 + f_10[i]*cx7;                          o[INDEX3(i,0,1,numComp,2)] = (f_10[i]-f_00[i])*cx2;
1025                          o[INDEX3(i,1,1,numComp,2)] = f_00[i]*cy3 + f_01[i]*cy4 + f_10[i]*cy1 + f_11[i]*cy6;                          o[INDEX3(i,1,1,numComp,2)] = (f_01[i]-f_00[i])*cy0 + (f_11[i]-f_10[i])*cy1;
1026                      } /* end of component loop i */                      } // end of component loop i
1027                  } /* end of k0 loop */                  } // end of k0 loop
1028              } /* end of face 2 */              } // end of face 2
1029              if (m_faceOffset[3] > -1) {              if (m_faceOffset[3] > -1) {
1030  #pragma omp for nowait  #pragma omp for nowait
1031                  for (index_t k0=0; k0 < m_NE0; ++k0) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1032                      const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,m_N1-1, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,m_NN[1]-2, m_NN[0])), numComp*sizeof(double));
1033                      const double* f_01 = in.getSampleDataRO(INDEX2(k0,m_N1-1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,m_NN[1]-1, m_NN[0])), numComp*sizeof(double));
1034                      const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,m_N1-2, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,m_NN[1]-2, m_NN[0])), numComp*sizeof(double));
1035                      const double* f_00 = in.getSampleDataRO(INDEX2(k0,m_N1-2, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,m_NN[1]-1, m_NN[0])), numComp*sizeof(double));
1036                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);
1037                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1038                          o[INDEX3(i,0,0,numComp,2)] = f_01[i]*cx0 + f_11[i]*cx7;                          o[INDEX3(i,0,0,numComp,2)] = (f_11[i]-f_01[i])*cx2;
1039                          o[INDEX3(i,1,0,numComp,2)] = f_00[i]*cy1 + f_01[i]*cy6 + f_10[i]*cy3 + f_11[i]*cy4;                          o[INDEX3(i,1,0,numComp,2)] = (f_01[i]-f_00[i])*cy1 + (f_11[i]-f_10[i])*cy0;
1040                          o[INDEX3(i,0,1,numComp,2)] = f_01[i]*cx0 + f_11[i]*cx7;                          o[INDEX3(i,0,1,numComp,2)] = (f_11[i]-f_01[i])*cx2;
1041                          o[INDEX3(i,1,1,numComp,2)] = f_00[i]*cy3 + f_01[i]*cy4 + f_10[i]*cy1 + f_11[i]*cy6;                          o[INDEX3(i,1,1,numComp,2)] = (f_01[i]-f_00[i])*cy0 + (f_11[i]-f_10[i])*cy1;
1042                      } /* end of component loop i */                      } // end of component loop i
1043                  } /* end of k0 loop */                  } // end of k0 loop
1044              } /* end of face 3 */              } // end of face 3
1045          } // end of parallel section          } // end of parallel section
1046    
1047      } else if (out.getFunctionSpace().getTypeCode() == ReducedFaceElements) {      } else if (out.getFunctionSpace().getTypeCode() == ReducedFaceElements) {
1048          out.requireWrite();          out.requireWrite();
1049  #pragma omp parallel  #pragma omp parallel
1050          {          {
1051                vector<double> f_00(numComp);
1052                vector<double> f_01(numComp);
1053                vector<double> f_10(numComp);
1054                vector<double> f_11(numComp);
1055              if (m_faceOffset[0] > -1) {              if (m_faceOffset[0] > -1) {
1056  #pragma omp for nowait  #pragma omp for nowait
1057                  for (index_t k1=0; k1 < m_NE1; ++k1) {                  for (index_t k1=0; k1 < m_NE[1]; ++k1) {
1058                      const double* f_10 = in.getSampleDataRO(INDEX2(1,k1, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(0,k1, m_NN[0])), numComp*sizeof(double));
1059                      const double* f_11 = in.getSampleDataRO(INDEX2(1,k1+1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(0,k1+1, m_NN[0])), numComp*sizeof(double));
1060                      const double* f_01 = in.getSampleDataRO(INDEX2(0,k1+1, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(1,k1, m_NN[0])), numComp*sizeof(double));
1061                      const double* f_00 = in.getSampleDataRO(INDEX2(0,k1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(1,k1+1, m_NN[0])), numComp*sizeof(double));
1062                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);
1063                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1064                          o[INDEX3(i,0,0,numComp,2)] = cx5*(f_10[i] + f_11[i]) + cx2*(f_00[i] + f_01[i]);                          o[INDEX3(i,0,0,numComp,2)] = (f_10[i] + f_11[i] - f_00[i] - f_01[i])*cx2/2;
1065                          o[INDEX3(i,1,0,numComp,2)] = f_00[i]*cy0 + f_01[i]*cy7;                          o[INDEX3(i,1,0,numComp,2)] = (f_01[i]-f_00[i])*cy2;
1066                      } /* end of component loop i */                      } // end of component loop i
1067                  } /* end of k1 loop */                  } // end of k1 loop
1068              } /* end of face 0 */              } // end of face 0
1069              if (m_faceOffset[1] > -1) {              if (m_faceOffset[1] > -1) {
1070  #pragma omp for nowait  #pragma omp for nowait
1071                  for (index_t k1=0; k1 < m_NE1; ++k1) {                  for (index_t k1=0; k1 < m_NE[1]; ++k1) {
1072                      const double* f_10 = in.getSampleDataRO(INDEX2(m_N0-1,k1, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(m_NN[0]-2,k1, m_NN[0])), numComp*sizeof(double));
1073                      const double* f_11 = in.getSampleDataRO(INDEX2(m_N0-1,k1+1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(m_NN[0]-2,k1+1, m_NN[0])), numComp*sizeof(double));
1074                      const double* f_01 = in.getSampleDataRO(INDEX2(m_N0-2,k1+1, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(m_NN[0]-1,k1, m_NN[0])), numComp*sizeof(double));
1075                      const double* f_00 = in.getSampleDataRO(INDEX2(m_N0-2,k1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(m_NN[0]-1,k1+1, m_NN[0])), numComp*sizeof(double));
1076                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);
1077                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1078                          o[INDEX3(i,0,0,numComp,2)] = cx5*(f_10[i] + f_11[i]) + cx2*(f_00[i] + f_01[i]);                          o[INDEX3(i,0,0,numComp,2)] = (f_10[i] + f_11[i] - f_00[i] - f_01[i])*cx2/2;
1079                          o[INDEX3(i,1,0,numComp,2)] = f_10[i]*cy0 + f_11[i]*cy7;                          o[INDEX3(i,1,0,numComp,2)] = (f_11[i]-f_10[i])*cy2;
1080                      } /* end of component loop i */                      } // end of component loop i
1081                  } /* end of k1 loop */                  } // end of k1 loop
1082              } /* end of face 1 */              } // end of face 1
1083              if (m_faceOffset[2] > -1) {              if (m_faceOffset[2] > -1) {
1084  #pragma omp for nowait  #pragma omp for nowait
1085                  for (index_t k0=0; k0 < m_NE0; ++k0) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1086                      const double* f_00 = in.getSampleDataRO(INDEX2(k0,0, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,0, m_NN[0])), numComp*sizeof(double));
1087                      const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,0, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,1, m_NN[0])), numComp*sizeof(double));
1088                      const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,1, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,0, m_NN[0])), numComp*sizeof(double));
1089                      const double* f_01 = in.getSampleDataRO(INDEX2(k0,1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,1, m_NN[0])), numComp*sizeof(double));
1090                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);
1091                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1092                          o[INDEX3(i,0,0,numComp,2)] = f_00[i]*cx0 + f_10[i]*cx7;                          o[INDEX3(i,0,0,numComp,2)] = (f_10[i]-f_00[i])*cx2;
1093                          o[INDEX3(i,1,0,numComp,2)] = cy2*(f_00[i] + f_10[i]) + cy5*(f_01[i] + f_11[i]);                          o[INDEX3(i,1,0,numComp,2)] = (f_01[i] + f_11[i] - f_00[i] - f_10[i])*cy2/2;
1094                      } /* end of component loop i */                      } // end of component loop i
1095                  } /* end of k0 loop */                  } // end of k0 loop
1096              } /* end of face 2 */              } // end of face 2
1097              if (m_faceOffset[3] > -1) {              if (m_faceOffset[3] > -1) {
1098  #pragma omp for nowait  #pragma omp for nowait
1099                  for (index_t k0=0; k0 < m_NE0; ++k0) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1100                      const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,m_N1-1, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,m_NN[1]-2, m_NN[0])), numComp*sizeof(double));
1101                      const double* f_01 = in.getSampleDataRO(INDEX2(k0,m_N1-1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,m_NN[1]-1, m_NN[0])), numComp*sizeof(double));
1102                      const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,m_N1-2, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,m_NN[1]-2, m_NN[0])), numComp*sizeof(double));
1103                      const double* f_00 = in.getSampleDataRO(INDEX2(k0,m_N1-2, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,m_NN[1]-1, m_NN[0])), numComp*sizeof(double));
1104                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);
1105                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1106                          o[INDEX3(i,0,0,numComp,2)] = f_01[i]*cx0 + f_11[i]*cx7;                          o[INDEX3(i,0,0,numComp,2)] = (f_11[i]-f_01[i])*cx2;
1107                          o[INDEX3(i,1,0,numComp,2)] = cy5*(f_01[i] + f_11[i]) + cy2*(f_00[i] + f_10[i]);                          o[INDEX3(i,1,0,numComp,2)] = (f_01[i] + f_11[i] - f_00[i] - f_10[i])*cy2/2;
1108                      } /* end of component loop i */                      } // end of component loop i
1109                  } /* end of k0 loop */                  } // end of k0 loop
1110              } /* end of face 3 */              } // end of face 3
1111          } // end of parallel section          } // end of parallel section
1112      }      }
1113  }  }
1114    
1115  //protected  //protected
1116  void Rectangle::assembleIntegrate(vector<double>& integrals, escript::Data& arg) const  void Rectangle::assembleIntegrate(vector<double>& integrals,
1117                                      const escript::Data& arg) const
1118  {  {
1119      const dim_t numComp = arg.getDataPointSize();      const dim_t numComp = arg.getDataPointSize();
1120      const double h0 = m_l0/m_gNE0;      const index_t left = (m_offset[0]==0 ? 0 : 1);
1121      const double h1 = m_l1/m_gNE1;      const index_t bottom = (m_offset[1]==0 ? 0 : 1);
1122      const index_t left = (m_offset0==0 ? 0 : 1);      const int fs=arg.getFunctionSpace().getTypeCode();
1123      const index_t bottom = (m_offset1==0 ? 0 : 1);      if (fs == Elements && arg.actsExpanded()) {
     if (arg.getFunctionSpace().getTypeCode() == Elements) {  
         const double w = h0*h1/4.;  
1124  #pragma omp parallel  #pragma omp parallel
1125          {          {
1126              vector<double> int_local(numComp, 0);              vector<double> int_local(numComp, 0);
1127                const double w = m_dx[0]*m_dx[1]/4.;
1128  #pragma omp for nowait  #pragma omp for nowait
1129              for (index_t k1 = bottom; k1 < bottom+m_ownNE1; ++k1) {              for (index_t k1 = bottom; k1 < bottom+m_ownNE[1]; ++k1) {
1130                  for (index_t k0 = left; k0 < left+m_ownNE0; ++k0) {                  for (index_t k0 = left; k0 < left+m_ownNE[0]; ++k0) {
1131                      const double* f = arg.getSampleDataRO(INDEX2(k0, k1, m_NE0));                      const double* f = arg.getSampleDataRO(INDEX2(k0, k1, m_NE[0]));
1132                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1133                          const double f0 = f[INDEX2(i,0,numComp)];                          const double f0 = f[INDEX2(i,0,numComp)];
1134                          const double f1 = f[INDEX2(i,1,numComp)];                          const double f1 = f[INDEX2(i,1,numComp)];
1135                          const double f2 = f[INDEX2(i,2,numComp)];                          const double f2 = f[INDEX2(i,2,numComp)];
1136                          const double f3 = f[INDEX2(i,3,numComp)];                          const double f3 = f[INDEX2(i,3,numComp)];
1137                          int_local[i]+=(f0+f1+f2+f3)*w;                          int_local[i]+=(f0+f1+f2+f3)*w;
1138                      }  /* end of component loop i */                      }  // end of component loop i
1139                  } /* end of k0 loop */                  } // end of k0 loop
1140              } /* end of k1 loop */              } // end of k1 loop
   
1141  #pragma omp critical  #pragma omp critical
1142              for (index_t i=0; i<numComp; i++)              for (index_t i=0; i<numComp; i++)
1143                  integrals[i]+=int_local[i];                  integrals[i]+=int_local[i];
1144          } // end of parallel section          } // end of parallel section
1145      } else if (arg.getFunctionSpace().getTypeCode() == ReducedElements) {  
1146          const double w = h0*h1;      } else if (fs==ReducedElements || (fs==Elements && !arg.actsExpanded())) {
1147            const double w = m_dx[0]*m_dx[1];
1148  #pragma omp parallel  #pragma omp parallel
1149          {          {
1150              vector<double> int_local(numComp, 0);              vector<double> int_local(numComp, 0);
1151  #pragma omp for nowait  #pragma omp for nowait
1152              for (index_t k1 = bottom; k1 < bottom+m_ownNE1; ++k1) {              for (index_t k1 = bottom; k1 < bottom+m_ownNE[1]; ++k1) {
1153                  for (index_t k0 = left; k0 < left+m_ownNE0; ++k0) {                  for (index_t k0 = left; k0 < left+m_ownNE[0]; ++k0) {
1154                      const double* f = arg.getSampleDataRO(INDEX2(k0, k1, m_NE0));                      const double* f = arg.getSampleDataRO(INDEX2(k0, k1, m_NE[0]));
1155                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1156                          int_local[i]+=f[i]*w;                          int_local[i]+=f[i]*w;
1157                      }  /* end of component loop i */                      }
1158                  } /* end of k0 loop */                  }
1159              } /* end of k1 loop */              }
   
1160  #pragma omp critical  #pragma omp critical
1161              for (index_t i=0; i<numComp; i++)              for (index_t i=0; i<numComp; i++)
1162                  integrals[i]+=int_local[i];                  integrals[i]+=int_local[i];
1163          } // end of parallel section          } // end of parallel section
1164      } else if (arg.getFunctionSpace().getTypeCode() == FaceElements) {  
1165          const double w0 = h0/2.;      } else if (fs == FaceElements && arg.actsExpanded()) {
         const double w1 = h1/2.;  
1166  #pragma omp parallel  #pragma omp parallel
1167          {          {
1168              vector<double> int_local(numComp, 0);              vector<double> int_local(numComp, 0);
1169                const double w0 = m_dx[0]/2.;
1170                const double w1 = m_dx[1]/2.;
1171              if (m_faceOffset[0] > -1) {              if (m_faceOffset[0] > -1) {
1172  #pragma omp for nowait  #pragma omp for nowait
1173                  for (index_t k1 = bottom; k1 < bottom+m_ownNE1; ++k1) {                  for (index_t k1 = bottom; k1 < bottom+m_ownNE[1]; ++k1) {
1174                      const double* f = arg.getSampleDataRO(m_faceOffset[0]+k1);                      const double* f = arg.getSampleDataRO(m_faceOffset[0]+k1);
1175                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1176                          const double f0 = f[INDEX2(i,0,numComp)];                          const double f0 = f[INDEX2(i,0,numComp)];
1177                          const double f1 = f[INDEX2(i,1,numComp)];                          const double f1 = f[INDEX2(i,1,numComp)];
1178                          int_local[i]+=(f0+f1)*w1;                          int_local[i]+=(f0+f1)*w1;
1179                      }  /* end of component loop i */                      }  // end of component loop i
1180                  } /* end of k1 loop */                  } // end of k1 loop
1181              }              }
1182    
1183              if (m_faceOffset[1] > -1) {              if (m_faceOffset[1] > -1) {
1184  #pragma omp for nowait  #pragma omp for nowait
1185                  for (index_t k1 = bottom; k1 < bottom+m_ownNE1; ++k1) {                  for (index_t k1 = bottom; k1 < bottom+m_ownNE[1]; ++k1) {
1186                      const double* f = arg.getSampleDataRO(m_faceOffset[1]+k1);                      const double* f = arg.getSampleDataRO(m_faceOffset[1]+k1);
1187                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1188                          const double f0 = f[INDEX2(i,0,numComp)];                          const double f0 = f[INDEX2(i,0,numComp)];
1189                          const double f1 = f[INDEX2(i,1,numComp)];                          const double f1 = f[INDEX2(i,1,numComp)];
1190                          int_local[i]+=(f0+f1)*w1;                          int_local[i]+=(f0+f1)*w1;
1191                      }  /* end of component loop i */                      }  // end of component loop i
1192                  } /* end of k1 loop */                  } // end of k1 loop
1193              }              }
1194    
1195              if (m_faceOffset[2] > -1) {              if (m_faceOffset[2] > -1) {
1196  #pragma omp for nowait  #pragma omp for nowait
1197                  for (index_t k0 = left; k0 < left+m_ownNE0; ++k0) {                  for (index_t k0 = left; k0 < left+m_ownNE[0]; ++k0) {
1198                      const double* f = arg.getSampleDataRO(m_faceOffset[2]+k0);                      const double* f = arg.getSampleDataRO(m_faceOffset[2]+k0);
1199                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1200                          const double f0 = f[INDEX2(i,0,numComp)];                          const double f0 = f[INDEX2(i,0,numComp)];
1201                          const double f1 = f[INDEX2(i,1,numComp)];                          const double f1 = f[INDEX2(i,1,numComp)];
1202                          int_local[i]+=(f0+f1)*w0;                          int_local[i]+=(f0+f1)*w0;
1203                      }  /* end of component loop i */                      }  // end of component loop i
1204                  } /* end of k0 loop */                  } // end of k0 loop
1205              }              }
1206    
1207              if (m_faceOffset[3] > -1) {              if (m_faceOffset[3] > -1) {
1208  #pragma omp for nowait  #pragma omp for nowait
1209                  for (index_t k0 = left; k0 < left+m_ownNE0; ++k0) {                  for (index_t k0 = left; k0 < left+m_ownNE[0]; ++k0) {
1210                      const double* f = arg.getSampleDataRO(m_faceOffset[3]+k0);                      const double* f = arg.getSampleDataRO(m_faceOffset[3]+k0);
1211                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1212                          const double f0 = f[INDEX2(i,0,numComp)];                          const double f0 = f[INDEX2(i,0,numComp)];
1213                          const double f1 = f[INDEX2(i,1,numComp)];                          const double f1 = f[INDEX2(i,1,numComp)];
1214                          int_local[i]+=(f0+f1)*w0;                          int_local[i]+=(f0+f1)*w0;
1215                      }  /* end of component loop i */                      }  // end of component loop i
1216                  } /* end of k0 loop */                  } // end of k0 loop
1217              }              }
   
1218  #pragma omp critical  #pragma omp critical
1219              for (index_t i=0; i<numComp; i++)              for (index_t i=0; i<numComp; i++)
1220                  integrals[i]+=int_local[i];                  integrals[i]+=int_local[i];
1221          } // end of parallel section          } // end of parallel section
1222      } else if (arg.getFunctionSpace().getTypeCode() == ReducedFaceElements) {  
1223        } else if (fs==ReducedFaceElements || (fs==FaceElements && !arg.actsExpanded())) {
1224  #pragma omp parallel  #pragma omp parallel
1225          {          {
1226              vector<double> int_local(numComp, 0);              vector<double> int_local(numComp, 0);
1227              if (m_faceOffset[0] > -1) {              if (m_faceOffset[0] > -1) {
1228  #pragma omp for nowait  #pragma omp for nowait
1229                  for (index_t k1 = bottom; k1 < bottom+m_ownNE1; ++k1) {                  for (index_t k1 = bottom; k1 < bottom+m_ownNE[1]; ++k1) {
1230                      const double* f = arg.getSampleDataRO(m_faceOffset[0]+k1);                      const double* f = arg.getSampleDataRO(m_faceOffset[0]+k1);
1231                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1232                          int_local[i]+=f[i]*h1;                          int_local[i]+=f[i]*m_dx[1];
1233                      }  /* end of component loop i */                      }
1234                  } /* end of k1 loop */                  }
1235              }              }
1236    
1237              if (m_faceOffset[1] > -1) {              if (m_faceOffset[1] > -1) {
1238  #pragma omp for nowait  #pragma omp for nowait
1239                  for (index_t k1 = bottom; k1 < bottom+m_ownNE1; ++k1) {                  for (index_t k1 = bottom; k1 < bottom+m_ownNE[1]; ++k1) {
1240                      const double* f = arg.getSampleDataRO(m_faceOffset[1]+k1);                      const double* f = arg.getSampleDataRO(m_faceOffset[1]+k1);
1241                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1242                          int_local[i]+=f[i]*h1;                          int_local[i]+=f[i]*m_dx[1];
1243                      }  /* end of component loop i */                      }
1244                  } /* end of k1 loop */                  }
1245              }              }
1246    
1247              if (m_faceOffset[2] > -1) {              if (m_faceOffset[2] > -1) {
1248  #pragma omp for nowait  #pragma omp for nowait
1249                  for (index_t k0 = left; k0 < left+m_ownNE0; ++k0) {                  for (index_t k0 = left; k0 < left+m_ownNE[0]; ++k0) {
1250                      const double* f = arg.getSampleDataRO(m_faceOffset[2]+k0);                      const double* f = arg.getSampleDataRO(m_faceOffset[2]+k0);
1251                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1252                          int_local[i]+=f[i]*h0;                          int_local[i]+=f[i]*m_dx[0];
1253                      }  /* end of component loop i */                      }
1254                  } /* end of k0 loop */                  }
1255              }              }
1256    
1257              if (m_faceOffset[3] > -1) {              if (m_faceOffset[3] > -1) {
1258  #pragma omp for nowait  #pragma omp for nowait
1259                  for (index_t k0 = left; k0 < left+m_ownNE0; ++k0) {                  for (index_t k0 = left; k0 < left+m_ownNE[0]; ++k0) {
1260                      const double* f = arg.getSampleDataRO(m_faceOffset[3]+k0);                      const double* f = arg.getSampleDataRO(m_faceOffset[3]+k0);
1261                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1262                          int_local[i]+=f[i]*h0;                          int_local[i]+=f[i]*m_dx[0];
1263                      }  /* end of component loop i */                      }
1264                  } /* end of k0 loop */                  }
1265              }              }
1266    
1267  #pragma omp critical  #pragma omp critical
1268              for (index_t i=0; i<numComp; i++)              for (index_t i=0; i<numComp; i++)
1269                  integrals[i]+=int_local[i];                  integrals[i]+=int_local[i];
1270          } // end of parallel section          } // end of parallel section
1271      }      } // function space selector
1272  }  }
1273    
1274  //protected  //protected
1275  dim_t Rectangle::insertNeighbourNodes(IndexVector& index, index_t node) const  dim_t Rectangle::insertNeighbourNodes(IndexVector& index, index_t node) const
1276  {  {
1277      const dim_t nDOF0 = (m_gNE0+1)/m_NX;      const dim_t nDOF0 = (m_gNE[0]+1)/m_NX[0];
1278      const dim_t nDOF1 = (m_gNE1+1)/m_NY;      const dim_t nDOF1 = (m_gNE[1]+1)/m_NX[1];
1279      const int x=node%nDOF0;      const int x=node%nDOF0;
1280      const int y=node/nDOF0;      const int y=node/nDOF0;
1281      dim_t num=0;      dim_t num=0;
# Line 989  dim_t Rectangle::insertNeighbourNodes(In Line 1300  dim_t Rectangle::insertNeighbourNodes(In
1300  }  }
1301    
1302  //protected  //protected
1303  void Rectangle::nodesToDOF(escript::Data& out, escript::Data& in) const  void Rectangle::nodesToDOF(escript::Data& out, const escript::Data& in) const
1304  {  {
1305      const dim_t numComp = in.getDataPointSize();      const dim_t numComp = in.getDataPointSize();
1306      out.requireWrite();      out.requireWrite();
1307    
1308      const index_t left = (m_offset0==0 ? 0 : 1);      const index_t left = (m_offset[0]==0 ? 0 : 1);
1309      const index_t bottom = (m_offset1==0 ? 0 : 1);      const index_t bottom = (m_offset[1]==0 ? 0 : 1);
1310      const dim_t nDOF0 = (m_gNE0+1)/m_NX;      const dim_t nDOF0 = (m_gNE[0]+1)/m_NX[0];
1311      const dim_t nDOF1 = (m_gNE1+1)/m_NY;      const dim_t nDOF1 = (m_gNE[1]+1)/m_NX[1];
1312  #pragma omp parallel for  #pragma omp parallel for
1313      for (index_t i=0; i<nDOF1; i++) {      for (index_t i=0; i<nDOF1; i++) {
1314          for (index_t j=0; j<nDOF0; j++) {          for (index_t j=0; j<nDOF0; j++) {
1315              const index_t n=j+left+(i+bottom)*m_N0;              const index_t n=j+left+(i+bottom)*m_NN[0];
1316              const double* src=in.getSampleDataRO(n);              const double* src=in.getSampleDataRO(n);
1317              copy(src, src+numComp, out.getSampleDataRW(j+i*nDOF0));              copy(src, src+numComp, out.getSampleDataRW(j+i*nDOF0));
1318          }          }
# Line 1009  void Rectangle::nodesToDOF(escript::Data Line 1320  void Rectangle::nodesToDOF(escript::Data
1320  }  }
1321    
1322  //protected  //protected
1323  void Rectangle::dofToNodes(escript::Data& out, escript::Data& in) const  void Rectangle::dofToNodes(escript::Data& out, const escript::Data& in) const
1324  {  {
1325      const dim_t numComp = in.getDataPointSize();      const dim_t numComp = in.getDataPointSize();
1326      Paso_Coupler* coupler = Paso_Coupler_alloc(m_connector, numComp);      Paso_Coupler* coupler = Paso_Coupler_alloc(m_connector, numComp);
1327      in.requireWrite();      // expand data object if necessary to be able to grab the whole data
1328      Paso_Coupler_startCollect(coupler, in.getSampleDataRW(0));      const_cast<escript::Data*>(&in)->expand();
1329        Paso_Coupler_startCollect(coupler, in.getSampleDataRO(0));
1330    
1331      const dim_t numDOF = getNumDOF();      const dim_t numDOF = getNumDOF();
1332      out.requireWrite();      out.requireWrite();
# Line 1027  void Rectangle::dofToNodes(escript::Data Line 1339  void Rectangle::dofToNodes(escript::Data
1339                  : &buffer[(m_dofMap[i]-numDOF)*numComp]);                  : &buffer[(m_dofMap[i]-numDOF)*numComp]);
1340          copy(src, src+numComp, out.getSampleDataRW(i));          copy(src, src+numComp, out.getSampleDataRW(i));
1341      }      }
1342        Paso_Coupler_free(coupler);
1343  }  }
1344    
1345  //private  //private
1346  void Rectangle::populateSampleIds()  void Rectangle::populateSampleIds()
1347  {  {
1348      // identifiers are ordered from left to right, bottom to top globablly.      // degrees of freedom are numbered from left to right, bottom to top in
1349        // each rank, continuing on the next rank (ranks also go left-right,
1350        // bottom-top).
1351        // This means rank 0 has id 0...n0-1, rank 1 has id n0...n1-1 etc. which
1352        // helps when writing out data rank after rank.
1353    
1354      // build node distribution vector first.      // build node distribution vector first.
1355      // rank i owns m_nodeDistribution[i+1]-nodeDistribution[i] nodes      // rank i owns m_nodeDistribution[i+1]-nodeDistribution[i] nodes which is
1356        // constant for all ranks in this implementation
1357      m_nodeDistribution.assign(m_mpiInfo->size+1, 0);      m_nodeDistribution.assign(m_mpiInfo->size+1, 0);
1358      const dim_t numDOF=getNumDOF();      const dim_t numDOF=getNumDOF();
1359      for (dim_t k=1; k<m_mpiInfo->size; k++) {      for (dim_t k=1; k<m_mpiInfo->size; k++) {
# Line 1045  void Rectangle::populateSampleIds() Line 1363  void Rectangle::populateSampleIds()
1363      m_nodeId.resize(getNumNodes());      m_nodeId.resize(getNumNodes());
1364      m_dofId.resize(numDOF);      m_dofId.resize(numDOF);
1365      m_elementId.resize(getNumElements());      m_elementId.resize(getNumElements());
1366    
1367        // populate face element counts
1368        //left
1369        if (m_offset[0]==0)
1370            m_faceCount[0]=m_NE[1];
1371        else
1372            m_faceCount[0]=0;
1373        //right
1374        if (m_mpiInfo->rank%m_NX[0]==m_NX[0]-1)
1375            m_faceCount[1]=m_NE[1];
1376        else
1377            m_faceCount[1]=0;
1378        //bottom
1379        if (m_offset[1]==0)
1380            m_faceCount[2]=m_NE[0];
1381        else
1382            m_faceCount[2]=0;
1383        //top
1384        if (m_mpiInfo->rank/m_NX[0]==m_NX[1]-1)
1385            m_faceCount[3]=m_NE[0];
1386        else
1387            m_faceCount[3]=0;
1388    
1389      m_faceId.resize(getNumFaceElements());      m_faceId.resize(getNumFaceElements());
1390    
1391        const index_t left = (m_offset[0]==0 ? 0 : 1);
1392        const index_t bottom = (m_offset[1]==0 ? 0 : 1);
1393        const dim_t nDOF0 = (m_gNE[0]+1)/m_NX[0];
1394        const dim_t nDOF1 = (m_gNE[1]+1)/m_NX[1];
1395    
1396    #define globalNodeId(x,y) \
1397        ((m_offset[0]+x)/nDOF0)*nDOF0*nDOF1+(m_offset[0]+x)%nDOF0 \
1398        + ((m_offset[1]+y)/nDOF1)*nDOF0*nDOF1*m_NX[0]+((m_offset[1]+y)%nDOF1)*nDOF0
1399    
1400        // set corner id's outside the parallel region
1401        m_nodeId[0] = globalNodeId(0, 0);
1402        m_nodeId[m_NN[0]-1] = globalNodeId(m_NN[0]-1, 0);
1403        m_nodeId[m_NN[0]*(m_NN[1]-1)] = globalNodeId(0, m_NN[1]-1);
1404        m_nodeId[m_NN[0]*m_NN[1]-1] = globalNodeId(m_NN[0]-1,m_NN[1]-1);
1405    #undef globalNodeId
1406    
1407  #pragma omp parallel  #pragma omp parallel
1408      {      {
1409          // nodes          // populate degrees of freedom and own nodes (identical id)
1410  #pragma omp for nowait  #pragma omp for nowait
1411          for (dim_t i1=0; i1<m_N1; i1++) {          for (dim_t i=0; i<nDOF1; i++) {
1412              for (dim_t i0=0; i0<m_N0; i0++) {              for (dim_t j=0; j<nDOF0; j++) {
1413                  m_nodeId[i0+i1*m_N0] = (m_offset1+i1)*(m_gNE0+1)+m_offset0+i0;                  const index_t nodeIdx=j+left+(i+bottom)*m_NN[0];
1414                    const index_t dofIdx=j+i*nDOF0;
1415                    m_dofId[dofIdx] = m_nodeId[nodeIdx]
1416                        = m_nodeDistribution[m_mpiInfo->rank]+dofIdx;
1417              }              }
1418          }          }
1419    
1420          // degrees of freedom          // populate the rest of the nodes (shared with other ranks)
1421            if (m_faceCount[0]==0) { // left column
1422    #pragma omp for nowait
1423                for (dim_t i=0; i<nDOF1; i++) {
1424                    const index_t nodeIdx=(i+bottom)*m_NN[0];
1425                    const index_t dofId=(i+1)*nDOF0-1;
1426                    m_nodeId[nodeIdx]
1427                        = m_nodeDistribution[m_mpiInfo->rank-1]+dofId;
1428                }
1429            }
1430            if (m_faceCount[1]==0) { // right column
1431    #pragma omp for nowait
1432                for (dim_t i=0; i<nDOF1; i++) {
1433                    const index_t nodeIdx=(i+bottom+1)*m_NN[0]-1;
1434                    const index_t dofId=i*nDOF0;
1435                    m_nodeId[nodeIdx]
1436                        = m_nodeDistribution[m_mpiInfo->rank+1]+dofId;
1437                }
1438            }
1439            if (m_faceCount[2]==0) { // bottom row
1440    #pragma omp for nowait
1441                for (dim_t i=0; i<nDOF0; i++) {
1442                    const index_t nodeIdx=i+left;
1443                    const index_t dofId=nDOF0*(nDOF1-1)+i;
1444                    m_nodeId[nodeIdx]
1445                        = m_nodeDistribution[m_mpiInfo->rank-m_NX[0]]+dofId;
1446                }
1447            }
1448            if (m_faceCount[3]==0) { // top row
1449  #pragma omp for nowait  #pragma omp for nowait
1450          for (dim_t k=0; k<numDOF; k++)              for (dim_t i=0; i<nDOF0; i++) {
1451              m_dofId[k] = m_nodeDistribution[m_mpiInfo->rank]+k;                  const index_t nodeIdx=m_NN[0]*(m_NN[1]-1)+i+left;
1452                    const index_t dofId=i;
1453                    m_nodeId[nodeIdx]
1454                        = m_nodeDistribution[m_mpiInfo->rank+m_NX[0]]+dofId;
1455                }
1456            }
1457    
1458          // elements          // populate element id's
1459  #pragma omp for nowait  #pragma omp for nowait
1460          for (dim_t i1=0; i1<m_NE1; i1++) {          for (dim_t i1=0; i1<m_NE[1]; i1++) {
1461              for (dim_t i0=0; i0<m_NE0; i0++) {              for (dim_t i0=0; i0<m_NE[0]; i0++) {
1462                  m_elementId[i0+i1*m_NE0]=(m_offset1+i1)*m_gNE0+m_offset0+i0;                  m_elementId[i0+i1*m_NE[0]]=(m_offset[1]+i1)*m_gNE[0]+m_offset[0]+i0;
1463              }              }
1464          }          }
1465    
# Line 1083  void Rectangle::populateSampleIds() Line 1476  void Rectangle::populateSampleIds()
1476      updateTagsInUse(Elements);      updateTagsInUse(Elements);
1477    
1478      // generate face offset vector and set face tags      // generate face offset vector and set face tags
     const IndexVector facesPerEdge = getNumFacesPerBoundary();  
1479      const index_t LEFT=1, RIGHT=2, BOTTOM=10, TOP=20;      const index_t LEFT=1, RIGHT=2, BOTTOM=10, TOP=20;
1480      const index_t faceTag[] = { LEFT, RIGHT, BOTTOM, TOP };      const index_t faceTag[] = { LEFT, RIGHT, BOTTOM, TOP };
1481      m_faceOffset.assign(facesPerEdge.size(), -1);      m_faceOffset.assign(4, -1);
1482      m_faceTags.clear();      m_faceTags.clear();
1483      index_t offset=0;      index_t offset=0;
1484      for (size_t i=0; i<facesPerEdge.size(); i++) {      for (size_t i=0; i<4; i++) {
1485          if (facesPerEdge[i]>0) {          if (m_faceCount[i]>0) {
1486              m_faceOffset[i]=offset;              m_faceOffset[i]=offset;
1487              offset+=facesPerEdge[i];              offset+=m_faceCount[i];
1488              m_faceTags.insert(m_faceTags.end(), facesPerEdge[i], faceTag[i]);              m_faceTags.insert(m_faceTags.end(), m_faceCount[i], faceTag[i]);
1489          }          }
1490      }      }
1491      setTagMap("left", LEFT);      setTagMap("left", LEFT);
# Line 1106  void Rectangle::populateSampleIds() Line 1498  void Rectangle::populateSampleIds()
1498  //private  //private
1499  void Rectangle::createPattern()  void Rectangle::createPattern()
1500  {  {
1501      const dim_t nDOF0 = (m_gNE0+1)/m_NX;      const dim_t nDOF0 = (m_gNE[0]+1)/m_NX[0];
1502      const dim_t nDOF1 = (m_gNE1+1)/m_NY;      const dim_t nDOF1 = (m_gNE[1]+1)/m_NX[1];
1503      const index_t left = (m_offset0==0 ? 0 : 1);      const index_t left = (m_offset[0]==0 ? 0 : 1);
1504      const index_t bottom = (m_offset1==0 ? 0 : 1);      const index_t bottom = (m_offset[1]==0 ? 0 : 1);
1505    
1506      // populate node->DOF mapping with own degrees of freedom.      // populate node->DOF mapping with own degrees of freedom.
1507      // The rest is assigned in the loop further down      // The rest is assigned in the loop further down
# Line 1117  void Rectangle::createPattern() Line 1509  void Rectangle::createPattern()
1509  #pragma omp parallel for  #pragma omp parallel for
1510      for (index_t i=bottom; i<bottom+nDOF1; i++) {      for (index_t i=bottom; i<bottom+nDOF1; i++) {
1511          for (index_t j=left; j<left+nDOF0; j++) {          for (index_t j=left; j<left+nDOF0; j++) {
1512              m_dofMap[i*m_N0+j]=(i-bottom)*nDOF0+j-left;              m_dofMap[i*m_NN[0]+j]=(i-bottom)*nDOF0+j-left;
1513          }          }
1514      }      }
1515    
# Line 1130  void Rectangle::createPattern() Line 1522  void Rectangle::createPattern()
1522      IndexVector offsetInShared(1,0);      IndexVector offsetInShared(1,0);
1523      IndexVector sendShared, recvShared;      IndexVector sendShared, recvShared;
1524      int numShared=0;      int numShared=0;
1525      const int x=m_mpiInfo->rank%m_NX;      const int x=m_mpiInfo->rank%m_NX[0];
1526      const int y=m_mpiInfo->rank/m_NX;      const int y=m_mpiInfo->rank/m_NX[0];
1527      for (int i1=-1; i1<2; i1++) {      for (int i1=-1; i1<2; i1++) {
1528          for (int i0=-1; i0<2; i0++) {          for (int i0=-1; i0<2; i0++) {
1529              // skip this rank              // skip this rank
# Line 1140  void Rectangle::createPattern() Line 1532  void Rectangle::createPattern()
1532              // location of neighbour rank              // location of neighbour rank
1533              const int nx=x+i0;              const int nx=x+i0;
1534              const int ny=y+i1;              const int ny=y+i1;
1535              if (nx>=0 && ny>=0 && nx<m_NX && ny<m_NY) {              if (nx>=0 && ny>=0 && nx<m_NX[0] && ny<m_NX[1]) {
1536                  neighbour.push_back(ny*m_NX+nx);                  neighbour.push_back(ny*m_NX[0]+nx);
1537                  if (i0==0) {                  if (i0==0) {
1538                      // sharing top or bottom edge                      // sharing top or bottom edge
1539                      const int firstDOF=(i1==-1 ? 0 : numDOF-nDOF0);                      const int firstDOF=(i1==-1 ? 0 : numDOF-nDOF0);
1540                      const int firstNode=(i1==-1 ? left : m_N0*(m_N1-1)+left);                      const int firstNode=(i1==-1 ? left : m_NN[0]*(m_NN[1]-1)+left);
1541                      offsetInShared.push_back(offsetInShared.back()+nDOF0);                      offsetInShared.push_back(offsetInShared.back()+nDOF0);
1542                      for (dim_t i=0; i<nDOF0; i++, numShared++) {                      for (dim_t i=0; i<nDOF0; i++, numShared++) {
1543                          sendShared.push_back(firstDOF+i);                          sendShared.push_back(firstDOF+i);
# Line 1160  void Rectangle::createPattern() Line 1552  void Rectangle::createPattern()
1552                  } else if (i1==0) {                  } else if (i1==0) {
1553                      // sharing left or right edge                      // sharing left or right edge
1554                      const int firstDOF=(i0==-1 ? 0 : nDOF0-1);                      const int firstDOF=(i0==-1 ? 0 : nDOF0-1);
1555                      const int firstNode=(i0==-1 ? bottom*m_N0 : (bottom+1)*m_N0-1);                      const int firstNode=(i0==-1 ? bottom*m_NN[0] : (bottom+1)*m_NN[0]-1);
1556                      offsetInShared.push_back(offsetInShared.back()+nDOF1);                      offsetInShared.push_back(offsetInShared.back()+nDOF1);
1557                      for (dim_t i=0; i<nDOF1; i++, numShared++) {                      for (dim_t i=0; i<nDOF1; i++, numShared++) {
1558                          sendShared.push_back(firstDOF+i*nDOF0);                          sendShared.push_back(firstDOF+i*nDOF0);
# Line 1170  void Rectangle::createPattern() Line 1562  void Rectangle::createPattern()
1562                          colIndices[firstDOF+i*nDOF0].push_back(numShared);                          colIndices[firstDOF+i*nDOF0].push_back(numShared);
1563                          if (i<nDOF1-1)                          if (i<nDOF1-1)
1564                              colIndices[firstDOF+(i+1)*nDOF0].push_back(numShared);                              colIndices[firstDOF+(i+1)*nDOF0].push_back(numShared);
1565                          m_dofMap[firstNode+i*m_N0]=numDOF+numShared;                          m_dofMap[firstNode+i*m_NN[0]]=numDOF+numShared;
1566                      }                      }
1567                  } else {                  } else {
1568                      // sharing a node                      // sharing a node
1569                      const int dof=(i0+1)/2*(nDOF0-1)+(i1+1)/2*(numDOF-nDOF0);                      const int dof=(i0+1)/2*(nDOF0-1)+(i1+1)/2*(numDOF-nDOF0);
1570                      const int node=(i0+1)/2*(m_N0-1)+(i1+1)/2*m_N0*(m_N1-1);                      const int node=(i0+1)/2*(m_NN[0]-1)+(i1+1)/2*m_NN[0]*(m_NN[1]-1);
1571                      offsetInShared.push_back(offsetInShared.back()+1);                      offsetInShared.push_back(offsetInShared.back()+1);
1572                      sendShared.push_back(dof);                      sendShared.push_back(dof);
1573                      recvShared.push_back(numDOF+numShared);                      recvShared.push_back(numDOF+numShared);
# Line 1285  void Rectangle::addToMatrixAndRHS(Paso_S Line 1677  void Rectangle::addToMatrixAndRHS(Paso_S
1677      IndexVector rowIndex;      IndexVector rowIndex;
1678      rowIndex.push_back(m_dofMap[firstNode]);      rowIndex.push_back(m_dofMap[firstNode]);
1679      rowIndex.push_back(m_dofMap[firstNode+1]);      rowIndex.push_back(m_dofMap[firstNode+1]);
1680      rowIndex.push_back(m_dofMap[firstNode+m_N0]);      rowIndex.push_back(m_dofMap[firstNode+m_NN[0]]);
1681      rowIndex.push_back(m_dofMap[firstNode+m_N0+1]);      rowIndex.push_back(m_dofMap[firstNode+m_NN[0]+1]);
1682      if (addF) {      if (addF) {
1683          double *F_p=F.getSampleDataRW(0);          double *F_p=F.getSampleDataRW(0);
1684          for (index_t i=0; i<rowIndex.size(); i++) {          for (index_t i=0; i<rowIndex.size(); i++) {
# Line 1304  void Rectangle::addToMatrixAndRHS(Paso_S Line 1696  void Rectangle::addToMatrixAndRHS(Paso_S
1696    
1697  //protected  //protected
1698  void Rectangle::interpolateNodesOnElements(escript::Data& out,  void Rectangle::interpolateNodesOnElements(escript::Data& out,
1699                                          escript::Data& in, bool reduced) const                                             const escript::Data& in,
1700                                               bool reduced) const
1701  {  {
1702      const dim_t numComp = in.getDataPointSize();      const dim_t numComp = in.getDataPointSize();
1703      if (reduced) {      if (reduced) {
1704          out.requireWrite();          out.requireWrite();
1705          const double c0 = .25;          const double c0 = 0.25;
1706  #pragma omp parallel for  #pragma omp parallel
1707          for (index_t k1=0; k1 < m_NE1; ++k1) {          {
1708              for (index_t k0=0; k0 < m_NE0; ++k0) {              vector<double> f_00(numComp);
1709                  const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,k1+1, m_N0));              vector<double> f_01(numComp);
1710                  const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,k1, m_N0));              vector<double> f_10(numComp);
1711                  const double* f_00 = in.getSampleDataRO(INDEX2(k0,k1, m_N0));              vector<double> f_11(numComp);
1712                  const double* f_01 = in.getSampleDataRO(INDEX2(k0,k1+1, m_N0));  #pragma omp for
1713                  double* o = out.getSampleDataRW(INDEX2(k0,k1,m_NE0));              for (index_t k1=0; k1 < m_NE[1]; ++k1) {
1714                  for (index_t i=0; i < numComp; ++i) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1715                      o[INDEX2(i,numComp,0)] = c0*(f_00[i] + f_01[i] + f_10[i] + f_11[i]);                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,k1, m_NN[0])), numComp*sizeof(double));
1716                  } /* end of component loop i */                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,k1+1, m_NN[0])), numComp*sizeof(double));
1717              } /* end of k0 loop */                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,k1, m_NN[0])), numComp*sizeof(double));
1718          } /* end of k1 loop */                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,k1+1, m_NN[0])), numComp*sizeof(double));
1719                        double* o = out.getSampleDataRW(INDEX2(k0,k1,m_NE[0]));
1720                        for (index_t i=0; i < numComp; ++i) {
1721                            o[INDEX2(i,numComp,0)] = c0*(f_00[i] + f_01[i] + f_10[i] + f_11[i]);
1722                        } /* end of component loop i */
1723                    } /* end of k0 loop */
1724                } /* end of k1 loop */
1725            } /* end of parallel section */
1726      } else {      } else {
1727          out.requireWrite();          out.requireWrite();
1728          const double c0 = .16666666666666666667;          const double c0 = 0.16666666666666666667;
1729          const double c1 = .044658198738520451079;          const double c1 = 0.044658198738520451079;
1730          const double c2 = .62200846792814621559;          const double c2 = 0.62200846792814621559;
1731  #pragma omp parallel for  #pragma omp parallel
1732          for (index_t k1=0; k1 < m_NE1; ++k1) {          {
1733              for (index_t k0=0; k0 < m_NE0; ++k0) {              vector<double> f_00(numComp);
1734                  const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,k1, m_N0));              vector<double> f_01(numComp);
1735                  const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,k1+1, m_N0));              vector<double> f_10(numComp);
1736                  const double* f_01 = in.getSampleDataRO(INDEX2(k0,k1+1, m_N0));              vector<double> f_11(numComp);
1737                  const double* f_00 = in.getSampleDataRO(INDEX2(k0,k1, m_N0));  #pragma omp for
1738                  double* o = out.getSampleDataRW(INDEX2(k0,k1,m_NE0));              for (index_t k1=0; k1 < m_NE[1]; ++k1) {
1739                  for (index_t i=0; i < numComp; ++i) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1740                      o[INDEX2(i,numComp,0)] = f_00[i]*c2 + f_11[i]*c1 + c0*(f_01[i] + f_10[i]);                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,k1, m_NN[0])), numComp*sizeof(double));
1741                      o[INDEX2(i,numComp,1)] = f_01[i]*c1 + f_10[i]*c2 + c0*(f_00[i] + f_11[i]);                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,k1+1, m_NN[0])), numComp*sizeof(double));
1742                      o[INDEX2(i,numComp,2)] = f_01[i]*c2 + f_10[i]*c1 + c0*(f_00[i] + f_11[i]);                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,k1, m_NN[0])), numComp*sizeof(double));
1743                      o[INDEX2(i,numComp,3)] = f_00[i]*c1 + f_11[i]*c2 + c0*(f_01[i] + f_10[i]);                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,k1+1, m_NN[0])), numComp*sizeof(double));
1744                  } /* end of component loop i */                      double* o = out.getSampleDataRW(INDEX2(k0,k1,m_NE[0]));
1745              } /* end of k0 loop */                      for (index_t i=0; i < numComp; ++i) {
1746          } /* end of k1 loop */                          o[INDEX2(i,numComp,0)] = c0*(f_01[i] + f_10[i]) + c1*f_11[i] + c2*f_00[i];
1747                            o[INDEX2(i,numComp,1)] = c0*(f_00[i] + f_11[i]) + c1*f_01[i] + c2*f_10[i];
1748                            o[INDEX2(i,numComp,2)] = c0*(f_00[i] + f_11[i]) + c1*f_10[i] + c2*f_01[i];
1749                            o[INDEX2(i,numComp,3)] = c0*(f_01[i] + f_10[i]) + c1*f_00[i] + c2*f_11[i];
1750                        } /* end of component loop i */
1751                    } /* end of k0 loop */
1752                } /* end of k1 loop */
1753            } /* end of parallel section */
1754      }      }
1755  }  }
1756    
1757  //protected  //protected
1758  void Rectangle::interpolateNodesOnFaces(escript::Data& out, escript::Data& in,  void Rectangle::interpolateNodesOnFaces(escript::Data& out,
1759                                            const escript::Data& in,
1760                                          bool reduced) const                                          bool reduced) const
1761  {  {
1762      const dim_t numComp = in.getDataPointSize();      const dim_t numComp = in.getDataPointSize();
1763      if (reduced) {      if (reduced) {
1764          out.requireWrite();          out.requireWrite();
         const double c0 = .5;  
1765  #pragma omp parallel  #pragma omp parallel
1766          {          {
1767                vector<double> f_00(numComp);
1768                vector<double> f_01(numComp);
1769                vector<double> f_10(numComp);
1770                vector<double> f_11(numComp);
1771              if (m_faceOffset[0] > -1) {              if (m_faceOffset[0] > -1) {
1772  #pragma omp for nowait  #pragma omp for nowait
1773                  for (index_t k1=0; k1 < m_NE1; ++k1) {                  for (index_t k1=0; k1 < m_NE[1]; ++k1) {
1774                      const double* f_00 = in.getSampleDataRO(INDEX2(0,k1, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(0,k1, m_NN[0])), numComp*sizeof(double));
1775                      const double* f_01 = in.getSampleDataRO(INDEX2(0,k1+1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(0,k1+1, m_NN[0])), numComp*sizeof(double));
1776                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);
1777                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1778                          o[INDEX2(i,numComp,0)] = c0*(f_00[i] + f_01[i]);                          o[INDEX2(i,numComp,0)] = (f_00[i] + f_01[i])/2;
1779                      } /* end of component loop i */                      } /* end of component loop i */
1780                  } /* end of k1 loop */                  } /* end of k1 loop */
1781              } /* end of face 0 */              } /* end of face 0 */
1782              if (m_faceOffset[1] > -1) {              if (m_faceOffset[1] > -1) {
1783  #pragma omp for nowait  #pragma omp for nowait
1784                  for (index_t k1=0; k1 < m_NE1; ++k1) {                  for (index_t k1=0; k1 < m_NE[1]; ++k1) {
1785                      const double* f_10 = in.getSampleDataRO(INDEX2(m_N0-1,k1, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(m_NN[0]-1,k1, m_NN[0])), numComp*sizeof(double));
1786                      const double* f_11 = in.getSampleDataRO(INDEX2(m_N0-1,k1+1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(m_NN[0]-1,k1+1, m_NN[0])), numComp*sizeof(double));
1787                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);
1788                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1789                          o[INDEX2(i,numComp,0)] = c0*(f_10[i] + f_11[i]);                          o[INDEX2(i,numComp,0)] = (f_10[i] + f_11[i])/2;
1790                      } /* end of component loop i */                      } /* end of component loop i */
1791                  } /* end of k1 loop */                  } /* end of k1 loop */
1792              } /* end of face 1 */              } /* end of face 1 */
1793              if (m_faceOffset[2] > -1) {              if (m_faceOffset[2] > -1) {
1794  #pragma omp for nowait  #pragma omp for nowait
1795                  for (index_t k0=0; k0 < m_NE0; ++k0) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1796                      const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,0, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,0, m_NN[0])), numComp*sizeof(double));
1797                      const double* f_00 = in.getSampleDataRO(INDEX2(k0,0, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,0, m_NN[0])), numComp*sizeof(double));
1798                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);
1799                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1800                          o[INDEX2(i,numComp,0)] = c0*(f_00[i] + f_10[i]);                          o[INDEX2(i,numComp,0)] = (f_00[i] + f_10[i])/2;
1801                      } /* end of component loop i */                      } /* end of component loop i */
1802                  } /* end of k0 loop */                  } /* end of k0 loop */
1803              } /* end of face 2 */              } /* end of face 2 */
1804              if (m_faceOffset[3] > -1) {              if (m_faceOffset[3] > -1) {
1805  #pragma omp for nowait  #pragma omp for nowait
1806                  for (index_t k0=0; k0 < m_NE0; ++k0) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1807                      const double* f_01 = in.getSampleDataRO(INDEX2(k0,m_N1-1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,m_NN[1]-1, m_NN[0])), numComp*sizeof(double));
1808                      const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,m_N1-1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,m_NN[1]-1, m_NN[0])), numComp*sizeof(double));
1809                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);
1810                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1811                          o[INDEX2(i,numComp,0)] = c0*(f_01[i] + f_11[i]);                          o[INDEX2(i,numComp,0)] = (f_01[i] + f_11[i])/2;
1812                      } /* end of component loop i */                      } /* end of component loop i */
1813                  } /* end of k0 loop */                  } /* end of k0 loop */
1814              } /* end of face 3 */              } /* end of face 3 */
1815          } // end of parallel section          } /* end of parallel section */
1816      } else {      } else {
1817          out.requireWrite();          out.requireWrite();
1818          const double c0 = 0.21132486540518711775;          const double c0 = 0.21132486540518711775;
1819          const double c1 = 0.78867513459481288225;          const double c1 = 0.78867513459481288225;
1820  #pragma omp parallel  #pragma omp parallel
1821          {          {
1822                vector<double> f_00(numComp);
1823                vector<double> f_01(numComp);
1824                vector<double> f_10(numComp);
1825                vector<double> f_11(numComp);
1826              if (m_faceOffset[0] > -1) {              if (m_faceOffset[0] > -1) {
1827  #pragma omp for nowait  #pragma omp for nowait
1828                  for (index_t k1=0; k1 < m_NE1; ++k1) {                  for (index_t k1=0; k1 < m_NE[1]; ++k1) {
1829                      const double* f_01 = in.getSampleDataRO(INDEX2(0,k1+1, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(0,k1, m_NN[0])), numComp*sizeof(double));
1830                      const double* f_00 = in.getSampleDataRO(INDEX2(0,k1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(0,k1+1, m_NN[0])), numComp*sizeof(double));
1831                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[0]+k1);
1832                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1833                          o[INDEX2(i,numComp,0)] = f_00[i]*c1 + f_01[i]*c0;                          o[INDEX2(i,numComp,0)] = c0*f_01[i] + c1*f_00[i];
1834                          o[INDEX2(i,numComp,1)] = f_00[i]*c0 + f_01[i]*c1;                          o[INDEX2(i,numComp,1)] = c0*f_00[i] + c1*f_01[i];
1835                      } /* end of component loop i */                      } /* end of component loop i */
1836                  } /* end of k1 loop */                  } /* end of k1 loop */
1837              } /* end of face 0 */              } /* end of face 0 */
1838              if (m_faceOffset[1] > -1) {              if (m_faceOffset[1] > -1) {
1839  #pragma omp for nowait  #pragma omp for nowait
1840                  for (index_t k1=0; k1 < m_NE1; ++k1) {                  for (index_t k1=0; k1 < m_NE[1]; ++k1) {
1841                      const double* f_10 = in.getSampleDataRO(INDEX2(m_N0-1,k1, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(m_NN[0]-1,k1, m_NN[0])), numComp*sizeof(double));
1842                      const double* f_11 = in.getSampleDataRO(INDEX2(m_N0-1,k1+1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(m_NN[0]-1,k1+1, m_NN[0])), numComp*sizeof(double));
1843                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);                      double* o = out.getSampleDataRW(m_faceOffset[1]+k1);
1844                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1845                          o[INDEX2(i,numComp,0)] = f_10[i]*c1 + f_11[i]*c0;                          o[INDEX2(i,numComp,0)] = c1*f_10[i] + c0*f_11[i];
1846                          o[INDEX2(i,numComp,1)] = f_10[i]*c0 + f_11[i]*c1;                          o[INDEX2(i,numComp,1)] = c1*f_11[i] + c0*f_10[i];
1847                      } /* end of component loop i */                      } /* end of component loop i */
1848                  } /* end of k1 loop */                  } /* end of k1 loop */
1849              } /* end of face 1 */              } /* end of face 1 */
1850              if (m_faceOffset[2] > -1) {              if (m_faceOffset[2] > -1) {
1851  #pragma omp for nowait  #pragma omp for nowait
1852                  for (index_t k0=0; k0 < m_NE0; ++k0) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1853                      const double* f_10 = in.getSampleDataRO(INDEX2(k0+1,0, m_N0));                      memcpy(&f_00[0], in.getSampleDataRO(INDEX2(k0,0, m_NN[0])), numComp*sizeof(double));
1854                      const double* f_00 = in.getSampleDataRO(INDEX2(k0,0, m_N0));                      memcpy(&f_10[0], in.getSampleDataRO(INDEX2(k0+1,0, m_NN[0])), numComp*sizeof(double));
1855                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[2]+k0);
1856                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1857                          o[INDEX2(i,numComp,0)] = f_00[i]*c1 + f_10[i]*c0;                          o[INDEX2(i,numComp,0)] = c0*f_10[i] + c1*f_00[i];
1858                          o[INDEX2(i,numComp,1)] = f_00[i]*c0 + f_10[i]*c1;                          o[INDEX2(i,numComp,1)] = c0*f_00[i] + c1*f_10[i];
1859                      } /* end of component loop i */                      } /* end of component loop i */
1860                  } /* end of k0 loop */                  } /* end of k0 loop */
1861              } /* end of face 2 */              } /* end of face 2 */
1862              if (m_faceOffset[3] > -1) {              if (m_faceOffset[3] > -1) {
1863  #pragma omp for nowait  #pragma omp for nowait
1864                  for (index_t k0=0; k0 < m_NE0; ++k0) {                  for (index_t k0=0; k0 < m_NE[0]; ++k0) {
1865                      const double* f_11 = in.getSampleDataRO(INDEX2(k0+1,m_N1-1, m_N0));                      memcpy(&f_01[0], in.getSampleDataRO(INDEX2(k0,m_NN[1]-1, m_NN[0])), numComp*sizeof(double));
1866                      const double* f_01 = in.getSampleDataRO(INDEX2(k0,m_N1-1, m_N0));                      memcpy(&f_11[0], in.getSampleDataRO(INDEX2(k0+1,m_NN[1]-1, m_NN[0])), numComp*sizeof(double));
1867                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);                      double* o = out.getSampleDataRW(m_faceOffset[3]+k0);
1868                      for (index_t i=0; i < numComp; ++i) {                      for (index_t i=0; i < numComp; ++i) {
1869                          o[INDEX2(i,numComp,0)] = f_01[i]*c1 + f_11[i]*c0;                          o[INDEX2(i,numComp,0)] = c0*f_11[i] + c1*f_01[i];
1870                          o[INDEX2(i,numComp,1)] = f_01[i]*c0 + f_11[i]*c1;                          o[INDEX2(i,numComp,1)] = c0*f_01[i] + c1*f_11[i];
1871                      } /* end of component loop i */                      } /* end of component loop i */
1872                  } /* end of k0 loop */                  } /* end of k0 loop */
1873              } /* end of face 3 */              } /* end of face 3 */
1874          } // end of parallel section          } /* end of parallel section */
1875      }      }
1876  }  }
1877    
 //protected  
 void Rectangle::assemblePDESingle(Paso_SystemMatrix* mat,  
         escript::Data& rhs, const escript::Data& A, const escript::Data& B,  
         const escript::Data& C, const escript::Data& D,  
         const escript::Data& X, const escript::Data& Y) const  
 {  
     const double h0 = m_l0/m_gNE0;  
     const double h1 = m_l1/m_gNE1;  
     const double w0 = -0.1555021169820365539*h1/h0;  
     const double w1 = 0.041666666666666666667;  
     const double w2 = -0.15550211698203655390;  
     const double w3 = 0.041666666666666666667*h0/h1;  
     const double w4 = 0.15550211698203655390;  
     const double w5 = -0.041666666666666666667;  
     const double w6 = -0.01116454968463011277*h1/h0;  
     const double w7 = 0.011164549684630112770;  
     const double w8 = -0.011164549684630112770;  
     const double w9 = -0.041666666666666666667*h1/h0;  
     const double w10 = -0.041666666666666666667*h0/h1;  
     const double w11 = 0.1555021169820365539*h1/h0;  
     const double w12 = 0.1555021169820365539*h0/h1;  
     const double w13 = 0.01116454968463011277*h0/h1;  
     const double w14 = 0.01116454968463011277*h1/h0;  
     const double w15 = 0.041666666666666666667*h1/h0;  
     const double w16 = -0.01116454968463011277*h0/h1;  
     const double w17 = -0.1555021169820365539*h0/h1;  
     const double w18 = -0.33333333333333333333*h1/h0;  
     const double w19 = 0.25;  
     const double w20 = -0.25;  
     const double w21 = 0.16666666666666666667*h0/h1;  
     const double w22 = -0.16666666666666666667*h1/h0;  
     const double w23 = -0.16666666666666666667*h0/h1;  
     const double w24 = 0.33333333333333333333*h1/h0;  
     const double w25 = 0.33333333333333333333*h0/h1;  
     const double w26 = 0.16666666666666666667*h1/h0;  
     const double w27 = -0.33333333333333333333*h0/h1;  
     const double w28 = -0.032861463941450536761*h1;  
     const double w29 = -0.032861463941450536761*h0;  
     const double w30 = -0.12264065304058601714*h1;  
     const double w31 = -0.0023593469594139828636*h1;  
     const double w32 = -0.008805202725216129906*h0;  
     const double w33 = -0.008805202725216129906*h1;  
     const double w34 = 0.032861463941450536761*h1;  
     const double w35 = 0.008805202725216129906*h1;  
     const double w36 = 0.008805202725216129906*h0;  
     const double w37 = 0.0023593469594139828636*h1;  
     const double w38 = 0.12264065304058601714*h1;  
     const double w39 = 0.032861463941450536761*h0;  
     const double w40 = -0.12264065304058601714*h0;  
     const double w41 = -0.0023593469594139828636*h0;  
     const double w42 = 0.0023593469594139828636*h0;  
     const double w43 = 0.12264065304058601714*h0;  
     const double w44 = -0.16666666666666666667*h1;  
     const double w45 = -0.083333333333333333333*h0;  
     const double w46 = 0.083333333333333333333*h1;  
     const double w47 = 0.16666666666666666667*h1;  
     const double w48 = 0.083333333333333333333*h0;  
     const double w49 = -0.16666666666666666667*h0;  
     const double w50 = 0.16666666666666666667*h0;  
     const double w51 = -0.083333333333333333333*h1;  
     const double w52 = 0.025917019497006092316*h0*h1;  
     const double w53 = 0.0018607582807716854616*h0*h1;  
     const double w54 = 0.0069444444444444444444*h0*h1;  
     const double w55 = 0.09672363354357992482*h0*h1;  
     const double w56 = 0.00049858867864229740201*h0*h1;  
     const double w57 = 0.055555555555555555556*h0*h1;  
     const double w58 = 0.027777777777777777778*h0*h1;  
     const double w59 = 0.11111111111111111111*h0*h1;  
     const double w60 = -0.19716878364870322056*h1;  
     const double w61 = -0.19716878364870322056*h0;  
     const double w62 = -0.052831216351296779436*h0;  
     const double w63 = -0.052831216351296779436*h1;  
     const double w64 = 0.19716878364870322056*h1;  
     const double w65 = 0.052831216351296779436*h1;  
     const double w66 = 0.19716878364870322056*h0;  
     const double w67 = 0.052831216351296779436*h0;  
     const double w68 = -0.5*h1;  
     const double w69 = -0.5*h0;  
     const double w70 = 0.5*h1;  
     const double w71 = 0.5*h0;  
     const double w72 = 0.1555021169820365539*h0*h1;  
     const double w73 = 0.041666666666666666667*h0*h1;  
     const double w74 = 0.01116454968463011277*h0*h1;  
     const double w75 = 0.25*h0*h1;  
1878    
     rhs.requireWrite();  
 #pragma omp parallel  
     {  
         for (index_t k1_0=0; k1_0<2; k1_0++) { // colouring  
 #pragma omp for  
             for (index_t k1=k1_0; k1<m_NE1; k1+=2) {  
                 for (index_t k0=0; k0<m_NE0; ++k0)  {  
                     bool add_EM_S=false;  
                     bool add_EM_F=false;  
                     vector<double> EM_S(4*4, 0);  
                     vector<double> EM_F(4, 0);  
                     const index_t e = k0 + m_NE0*k1;  
                     ///////////////  
                     // process A //  
                     ///////////////  
                     if (!A.isEmpty()) {  
                         add_EM_S=true;  
                         const double* A_p=const_cast<escript::Data*>(&A)->getSampleDataRO(e);  
                         if (A.actsExpanded()) {  
                             const double A_00_0 = A_p[INDEX3(0,0,0,2,2)];  
                             const double A_10_0 = A_p[INDEX3(1,0,0,2,2)];  
                             const double A_01_0 = A_p[INDEX3(0,1,0,2,2)];  
                             const double A_11_0 = A_p[INDEX3(1,1,0,2,2)];  
                             const double A_00_1 = A_p[INDEX3(0,0,1,2,2)];  
                             const double A_10_1 = A_p[INDEX3(1,0,1,2,2)];  
                             const double A_01_1 = A_p[INDEX3(0,1,1,2,2)];  
                             const double A_11_1 = A_p[INDEX3(1,1,1,2,2)];  
                             const double A_00_2 = A_p[INDEX3(0,0,2,2,2)];  
                             const double A_10_2 = A_p[INDEX3(1,0,2,2,2)];  
                             const double A_01_2 = A_p[INDEX3(0,1,2,2,2)];  
                             const double A_11_2 = A_p[INDEX3(1,1,2,2,2)];  
                             const double A_00_3 = A_p[INDEX3(0,0,3,2,2)];  
                             const double A_10_3 = A_p[INDEX3(1,0,3,2,2)];  
                             const double A_01_3 = A_p[INDEX3(0,1,3,2,2)];  
                             const double A_11_3 = A_p[INDEX3(1,1,3,2,2)];  
                             const double tmp0_0 = A_01_0 + A_01_3;  
                             const double tmp1_0 = A_00_0 + A_00_1;  
                             const double tmp2_0 = A_11_0 + A_11_1 + A_11_2 + A_11_3;  
                             const double tmp3_0 = A_00_2 + A_00_3;  
                             const double tmp4_0 = A_10_1 + A_10_2;  
                             const double tmp5_0 = A_00_0 + A_00_1 + A_00_2 + A_00_3;  
                             const double tmp6_0 = A_01_3 + A_10_0;  
                             const double tmp7_0 = A_01_0 + A_10_3;  
                             const double tmp8_0 = A_01_1 + A_01_2 + A_10_1 + A_10_2;  
                             const double tmp9_0 = A_01_0 + A_10_0;  
                             const double tmp12_0 = A_11_0 + A_11_2;  
                             const double tmp10_0 = A_01_3 + A_10_3;  
                             const double tmp14_0 = A_01_0 + A_01_3 + A_10_0 + A_10_3;  
                             const double tmp13_0 = A_01_2 + A_10_1;  
                             const double tmp11_0 = A_11_1 + A_11_3;  
                             const double tmp18_0 = A_01_1 + A_10_1;  
                             const double tmp15_0 = A_01_1 + A_10_2;  
                             const double tmp16_0 = A_10_0 + A_10_3;  
                             const double tmp17_0 = A_01_1 + A_01_2;  
                             const double tmp19_0 = A_01_2 + A_10_2;  
                             const double tmp0_1 = A_10_3*w8;  
                             const double tmp1_1 = tmp0_0*w1;  
                             const double tmp2_1 = A_01_1*w4;  
                             const double tmp3_1 = tmp1_0*w0;  
                             const double tmp4_1 = A_01_2*w7;  
                             const double tmp5_1 = tmp2_0*w3;  
                             const double tmp6_1 = tmp3_0*w6;  
                             const double tmp7_1 = A_10_0*w2;  
                             const double tmp8_1 = tmp4_0*w5;  
                             const double tmp9_1 = tmp2_0*w10;  
                             const double tmp14_1 = A_10_0*w8;  
                             const double tmp23_1 = tmp3_0*w14;  
                             const double tmp35_1 = A_01_0*w8;  
                             const double tmp54_1 = tmp13_0*w8;  
                             const double tmp20_1 = tmp9_0*w4;  
                             const double tmp25_1 = tmp12_0*w12;  
                             const double tmp44_1 = tmp7_0*w7;  
                             const double tmp26_1 = tmp10_0*w4;  
                             const double tmp52_1 = tmp18_0*w8;  
                             const double tmp48_1 = A_10_1*w7;  
                             const double tmp46_1 = A_01_3*w8;  
                             const double tmp50_1 = A_01_0*w2;  
                             const double tmp56_1 = tmp19_0*w8;  
                             const double tmp19_1 = A_10_3*w2;  
                             const double tmp47_1 = A_10_2*w4;  
                             const double tmp16_1 = tmp3_0*w0;  
                             const double tmp18_1 = tmp1_0*w6;  
                             const double tmp31_1 = tmp11_0*w12;  
                             const double tmp55_1 = tmp15_0*w2;  
                             const double tmp39_1 = A_10_2*w7;  
                             const double tmp11_1 = tmp6_0*w7;  
                             const double tmp40_1 = tmp11_0*w17;  
                             const double tmp34_1 = tmp15_0*w8;  
                             const double tmp33_1 = tmp14_0*w5;  
                             const double tmp24_1 = tmp11_0*w13;  
                             const double tmp43_1 = tmp17_0*w5;  
                             const double tmp15_1 = A_01_2*w4;  
                             const double tmp53_1 = tmp19_0*w2;  
                             const double tmp27_1 = tmp3_0*w11;  
                             const double tmp32_1 = tmp13_0*w2;  
                             const double tmp10_1 = tmp5_0*w9;  
                             const double tmp37_1 = A_10_1*w4;  
                             const double tmp38_1 = tmp5_0*w15;  
                             const double tmp17_1 = A_01_1*w7;  
                             const double tmp12_1 = tmp7_0*w4;  
                             const double tmp22_1 = tmp10_0*w7;  
                             const double tmp57_1 = tmp18_0*w2;  
                             const double tmp28_1 = tmp9_0*w7;  
                             const double tmp29_1 = tmp1_0*w14;  
                             const double tmp51_1 = tmp11_0*w16;  
                             const double tmp42_1 = tmp12_0*w16;  
                             const double tmp49_1 = tmp12_0*w17;  
                             const double tmp21_1 = tmp1_0*w11;  
                             const double tmp45_1 = tmp6_0*w4;  
                             const double tmp13_1 = tmp8_0*w1;  
                             const double tmp36_1 = tmp16_0*w1;  
                             const double tmp41_1 = A_01_3*w2;  
                             const double tmp30_1 = tmp12_0*w13;  
                             EM_S[INDEX2(0,0,4)]+=tmp13_1 + tmp20_1 + tmp21_1 + tmp22_1 + tmp23_1 + tmp24_1 + tmp25_1;  
                             EM_S[INDEX2(1,0,4)]+=tmp36_1 + tmp37_1 + tmp39_1 + tmp3_1 + tmp43_1 + tmp46_1 + tmp50_1 + tmp5_1 + tmp6_1;  
                             EM_S[INDEX2(2,0,4)]+=tmp0_1 + tmp15_1 + tmp17_1 + tmp1_1 + tmp38_1 + tmp49_1 + tmp51_1 + tmp7_1 + tmp8_1;  
                             EM_S[INDEX2(3,0,4)]+=tmp10_1 + tmp32_1 + tmp33_1 + tmp34_1 + tmp9_1;  
                             EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1 + tmp4_1 + tmp5_1 + tmp6_1 + tmp7_1 + tmp8_1;  
                             EM_S[INDEX2(1,1,4)]+=tmp21_1 + tmp23_1 + tmp30_1 + tmp31_1 + tmp33_1 + tmp56_1 + tmp57_1;  
                             EM_S[INDEX2(2,1,4)]+=tmp10_1 + tmp13_1 + tmp44_1 + tmp45_1 + tmp9_1;  
                             EM_S[INDEX2(3,1,4)]+=tmp35_1 + tmp36_1 + tmp37_1 + tmp38_1 + tmp39_1 + tmp40_1 + tmp41_1 + tmp42_1 + tmp43_1;  
                             EM_S[INDEX2(0,2,4)]+=tmp36_1 + tmp38_1 + tmp43_1 + tmp46_1 + tmp47_1 + tmp48_1 + tmp49_1 + tmp50_1 + tmp51_1;  
                             EM_S[INDEX2(1,2,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1 + tmp9_1;  
                             EM_S[INDEX2(2,2,4)]+=tmp24_1 + tmp25_1 + tmp27_1 + tmp29_1 + tmp33_1 + tmp52_1 + tmp53_1;  
                             EM_S[INDEX2(3,2,4)]+=tmp14_1 + tmp15_1 + tmp16_1 + tmp17_1 + tmp18_1 + tmp19_1 + tmp1_1 + tmp5_1 + tmp8_1;  
                             EM_S[INDEX2(0,3,4)]+=tmp10_1 + tmp33_1 + tmp54_1 + tmp55_1 + tmp9_1;  
                             EM_S[INDEX2(1,3,4)]+=tmp14_1 + tmp19_1 + tmp1_1 + tmp2_1 + tmp38_1 + tmp40_1 + tmp42_1 + tmp4_1 + tmp8_1;  
                             EM_S[INDEX2(2,3,4)]+=tmp16_1 + tmp18_1 + tmp35_1 + tmp36_1 + tmp41_1 + tmp43_1 + tmp47_1 + tmp48_1 + tmp5_1;  
                             EM_S[INDEX2(3,3,4)]+=tmp13_1 + tmp26_1 + tmp27_1 + tmp28_1 + tmp29_1 + tmp30_1 + tmp31_1;  
                         } else { // constant data  
                             const double A_00 = A_p[INDEX2(0,0,2)];  
                             const double A_10 = A_p[INDEX2(1,0,2)];  
                             const double A_01 = A_p[INDEX2(0,1,2)];  
                             const double A_11 = A_p[INDEX2(1,1,2)];  
                             const double tmp0_0 = A_01 + A_10;  
                             const double tmp0_1 = A_00*w18;  
                             const double tmp1_1 = A_01*w19;  
                             const double tmp2_1 = A_10*w20;  
                             const double tmp3_1 = A_11*w21;  
                             const double tmp4_1 = A_00*w22;  
                             const double tmp5_1 = tmp0_0*w19;  
                             const double tmp6_1 = A_11*w23;  
                             const double tmp7_1 = A_11*w25;  
                             const double tmp8_1 = A_00*w24;  
                             const double tmp9_1 = tmp0_0*w20;  
                             const double tmp10_1 = A_01*w20;  
                             const double tmp11_1 = A_11*w27;  
                             const double tmp12_1 = A_00*w26;  
                             const double tmp13_1 = A_10*w19;  
                             EM_S[INDEX2(0,0,4)]+=tmp5_1 + tmp7_1 + tmp8_1;  
                             EM_S[INDEX2(1,0,4)]+=tmp0_1 + tmp10_1 + tmp13_1 + tmp3_1;  
                             EM_S[INDEX2(2,0,4)]+=tmp11_1 + tmp12_1 + tmp1_1 + tmp2_1;  
                             EM_S[INDEX2(3,0,4)]+=tmp4_1 + tmp6_1 + tmp9_1;  
                             EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                             EM_S[INDEX2(1,1,4)]+=tmp7_1 + tmp8_1 + tmp9_1;  
                             EM_S[INDEX2(2,1,4)]+=tmp4_1 + tmp5_1 + tmp6_1;  
                             EM_S[INDEX2(3,1,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1;  
                             EM_S[INDEX2(0,2,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1;  
                             EM_S[INDEX2(1,2,4)]+=tmp4_1 + tmp5_1 + tmp6_1;  
                             EM_S[INDEX2(2,2,4)]+=tmp7_1 + tmp8_1 + tmp9_1;  
                             EM_S[INDEX2(3,2,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                             EM_S[INDEX2(0,3,4)]+=tmp4_1 + tmp6_1 + tmp9_1;  
                             EM_S[INDEX2(1,3,4)]+=tmp11_1 + tmp12_1 + tmp1_1 + tmp2_1;  
                             EM_S[INDEX2(2,3,4)]+=tmp0_1 + tmp10_1 + tmp13_1 + tmp3_1;  
                             EM_S[INDEX2(3,3,4)]+=tmp5_1 + tmp7_1 + tmp8_1;  
                         }  
                     }  
                     ///////////////  
                     // process B //  
                     ///////////////  
                     if (!B.isEmpty()) {  
                         add_EM_S=true;  
                         const double* B_p=const_cast<escript::Data*>(&B)->getSampleDataRO(e);  
                         if (B.actsExpanded()) {  
                             const double B_0_0 = B_p[INDEX2(0,0,2)];  
                             const double B_1_0 = B_p[INDEX2(1,0,2)];  
                             const double B_0_1 = B_p[INDEX2(0,1,2)];  
                             const double B_1_1 = B_p[INDEX2(1,1,2)];  
                             const double B_0_2 = B_p[INDEX2(0,2,2)];  
                             const double B_1_2 = B_p[INDEX2(1,2,2)];  
                             const double B_0_3 = B_p[INDEX2(0,3,2)];  
                             const double B_1_3 = B_p[INDEX2(1,3,2)];  
                             const double tmp0_0 = B_1_0 + B_1_1;  
                             const double tmp1_0 = B_1_2 + B_1_3;  
                             const double tmp2_0 = B_0_1 + B_0_3;  
                             const double tmp3_0 = B_0_0 + B_0_2;  
                             const double tmp63_1 = B_1_1*w42;  
                             const double tmp79_1 = B_1_1*w40;  
                             const double tmp37_1 = tmp3_0*w35;  
                             const double tmp8_1 = tmp0_0*w32;  
                             const double tmp71_1 = B_0_1*w34;  
                             const double tmp19_1 = B_0_3*w31;  
                             const double tmp15_1 = B_0_3*w34;  
                             const double tmp9_1 = tmp3_0*w34;  
                             const double tmp35_1 = B_1_0*w36;  
                             const double tmp66_1 = B_0_3*w28;  
                             const double tmp28_1 = B_1_0*w42;  
                             const double tmp22_1 = B_1_0*w40;  
                             const double tmp16_1 = B_1_2*w29;  
                             const double tmp6_1 = tmp2_0*w35;  
                             const double tmp55_1 = B_1_3*w40;  
                             const double tmp50_1 = B_1_3*w42;  
                             const double tmp7_1 = tmp1_0*w29;  
                             const double tmp1_1 = tmp1_0*w32;  
                             const double tmp57_1 = B_0_3*w30;  
                             const double tmp18_1 = B_1_1*w32;  
                             const double tmp53_1 = B_1_0*w41;  
                             const double tmp61_1 = B_1_3*w36;  
                             const double tmp27_1 = B_0_3*w38;  
                             const double tmp64_1 = B_0_2*w30;  
                             const double tmp76_1 = B_0_1*w38;  
                             const double tmp39_1 = tmp2_0*w34;  
                             const double tmp62_1 = B_0_1*w31;  
                             const double tmp56_1 = B_0_0*w31;  
                             const double tmp49_1 = B_1_1*w36;  
                             const double tmp2_1 = B_0_2*w31;  
                             const double tmp23_1 = B_0_2*w33;  
                             const double tmp38_1 = B_1_1*w43;  
                             const double tmp74_1 = B_1_2*w41;  
                             const double tmp43_1 = B_1_1*w41;  
                             const double tmp58_1 = B_0_2*w28;  
                             const double tmp67_1 = B_0_0*w33;  
                             const double tmp33_1 = tmp0_0*w39;  
                             const double tmp4_1 = B_0_0*w28;  
                             const double tmp20_1 = B_0_0*w30;  
                             const double tmp13_1 = B_0_2*w38;  
                             const double tmp65_1 = B_1_2*w43;  
                             const double tmp0_1 = tmp0_0*w29;  
                             const double tmp41_1 = tmp3_0*w33;  
                             const double tmp73_1 = B_0_2*w37;  
                             const double tmp69_1 = B_0_0*w38;  
                             const double tmp48_1 = B_1_2*w39;  
                             const double tmp59_1 = B_0_1*w33;  
                             const double tmp17_1 = B_1_3*w41;  
                             const double tmp5_1 = B_0_3*w33;  
                             const double tmp3_1 = B_0_1*w30;  
                             const double tmp21_1 = B_0_1*w28;  
                             const double tmp42_1 = B_1_0*w29;  
                             const double tmp54_1 = B_1_2*w32;  
                             const double tmp60_1 = B_1_0*w39;  
                             const double tmp32_1 = tmp1_0*w36;  
                             const double tmp10_1 = B_0_1*w37;  
                             const double tmp14_1 = B_0_0*w35;  
                             const double tmp29_1 = B_0_1*w35;  
                             const double tmp26_1 = B_1_2*w36;  
                             const double tmp30_1 = B_1_3*w43;  
                             const double tmp70_1 = B_0_2*w35;  
                             const double tmp34_1 = B_1_3*w39;  
                             const double tmp51_1 = B_1_0*w43;  
                             const double tmp31_1 = B_0_2*w34;  
                             const double tmp45_1 = tmp3_0*w28;  
                             const double tmp11_1 = tmp1_0*w39;  
                             const double tmp52_1 = B_1_1*w29;  
                             const double tmp44_1 = B_1_3*w32;  
                             const double tmp25_1 = B_1_1*w39;  
                             const double tmp47_1 = tmp2_0*w33;  
                             const double tmp72_1 = B_1_3*w29;  
                             const double tmp40_1 = tmp2_0*w28;  
                             const double tmp46_1 = B_1_2*w40;  
                             const double tmp36_1 = B_1_2*w42;  
                             const double tmp24_1 = B_0_0*w37;  
                             const double tmp77_1 = B_0_3*w35;  
                             const double tmp68_1 = B_0_3*w37;  
                             const double tmp78_1 = B_0_0*w34;  
                             const double tmp12_1 = tmp0_0*w36;  
                             const double tmp75_1 = B_1_0*w32;  
                             EM_S[INDEX2(0,0,4)]+=tmp16_1 + tmp17_1 + tmp18_1 + tmp19_1 + tmp20_1 + tmp21_1 + tmp22_1 + tmp23_1;  
                             EM_S[INDEX2(1,0,4)]+=tmp0_1 + tmp1_1 + tmp68_1 + tmp69_1 + tmp70_1 + tmp71_1;  
                             EM_S[INDEX2(2,0,4)]+=tmp45_1 + tmp47_1 + tmp48_1 + tmp49_1 + tmp50_1 + tmp51_1;  
                             EM_S[INDEX2(3,0,4)]+=tmp32_1 + tmp33_1 + tmp6_1 + tmp9_1;  
                             EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1 + tmp4_1 + tmp5_1;  
                             EM_S[INDEX2(1,1,4)]+=tmp72_1 + tmp73_1 + tmp74_1 + tmp75_1 + tmp76_1 + tmp77_1 + tmp78_1 + tmp79_1;  
                             EM_S[INDEX2(2,1,4)]+=tmp32_1 + tmp33_1 + tmp40_1 + tmp41_1;  
                             EM_S[INDEX2(3,1,4)]+=tmp34_1 + tmp35_1 + tmp36_1 + tmp37_1 + tmp38_1 + tmp39_1;  
                             EM_S[INDEX2(0,2,4)]+=tmp42_1 + tmp43_1 + tmp44_1 + tmp45_1 + tmp46_1 + tmp47_1;  
                             EM_S[INDEX2(1,2,4)]+=tmp6_1 + tmp7_1 + tmp8_1 + tmp9_1;  
                             EM_S[INDEX2(2,2,4)]+=tmp60_1 + tmp61_1 + tmp62_1 + tmp63_1 + tmp64_1 + tmp65_1 + tmp66_1 + tmp67_1;  
                             EM_S[INDEX2(3,2,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1 + tmp14_1 + tmp15_1;  
                             EM_S[INDEX2(0,3,4)]+=tmp40_1 + tmp41_1 + tmp7_1 + tmp8_1;  
                             EM_S[INDEX2(1,3,4)]+=tmp37_1 + tmp39_1 + tmp52_1 + tmp53_1 + tmp54_1 + tmp55_1;  
                             EM_S[INDEX2(2,3,4)]+=tmp11_1 + tmp12_1 + tmp56_1 + tmp57_1 + tmp58_1 + tmp59_1;  
                             EM_S[INDEX2(3,3,4)]+=tmp24_1 + tmp25_1 + tmp26_1 + tmp27_1 + tmp28_1 + tmp29_1 + tmp30_1 + tmp31_1;  
                         } else { // constant data  
                             const double B_0 = B_p[0];  
                             const double B_1 = B_p[1];  
                             const double tmp0_1 = B_0*w44;  
                             const double tmp1_1 = B_1*w45;  
                             const double tmp2_1 = B_0*w46;  
                             const double tmp3_1 = B_0*w47;  
                             const double tmp4_1 = B_1*w48;  
                             const double tmp5_1 = B_1*w49;  
                             const double tmp6_1 = B_1*w50;  
                             const double tmp7_1 = B_0*w51;  
                             EM_S[INDEX2(0,0,4)]+=tmp0_1 + tmp5_1;  
                             EM_S[INDEX2(1,0,4)]+=tmp1_1 + tmp3_1;  
                             EM_S[INDEX2(2,0,4)]+=tmp6_1 + tmp7_1;  
                             EM_S[INDEX2(3,0,4)]+=tmp2_1 + tmp4_1;  
                             EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1;  
                             EM_S[INDEX2(1,1,4)]+=tmp3_1 + tmp5_1;  
                             EM_S[INDEX2(2,1,4)]+=tmp4_1 + tmp7_1;  
                             EM_S[INDEX2(3,1,4)]+=tmp2_1 + tmp6_1;  
                             EM_S[INDEX2(0,2,4)]+=tmp5_1 + tmp7_1;  
                             EM_S[INDEX2(1,2,4)]+=tmp1_1 + tmp2_1;  
                             EM_S[INDEX2(2,2,4)]+=tmp0_1 + tmp6_1;  
                             EM_S[INDEX2(3,2,4)]+=tmp3_1 + tmp4_1;  
                             EM_S[INDEX2(0,3,4)]+=tmp1_1 + tmp7_1;  
                             EM_S[INDEX2(1,3,4)]+=tmp2_1 + tmp5_1;  
                             EM_S[INDEX2(2,3,4)]+=tmp0_1 + tmp4_1;  
                             EM_S[INDEX2(3,3,4)]+=tmp3_1 + tmp6_1;  
                         }  
                     }  
                     ///////////////  
                     // process C //  
                     ///////////////  
                     if (!C.isEmpty()) {  
                         add_EM_S=true;  
                         const double* C_p=const_cast<escript::Data*>(&C)->getSampleDataRO(e);  
                         if (C.actsExpanded()) {  
                             const double C_0_0 = C_p[INDEX2(0,0,2)];  
                             const double C_1_0 = C_p[INDEX2(1,0,2)];  
                             const double C_0_1 = C_p[INDEX2(0,1,2)];  
                             const double C_1_1 = C_p[INDEX2(1,1,2)];  
                             const double C_0_2 = C_p[INDEX2(0,2,2)];  
                             const double C_1_2 = C_p[INDEX2(1,2,2)];  
                             const double C_0_3 = C_p[INDEX2(0,3,2)];  
                             const double C_1_3 = C_p[INDEX2(1,3,2)];  
                             const double tmp0_0 = C_1_0 + C_1_1;  
                             const double tmp1_0 = C_1_2 + C_1_3;  
                             const double tmp2_0 = C_0_1 + C_0_3;  
                             const double tmp3_0 = C_0_0 + C_0_2;  
                             const double tmp64_1 = C_0_2*w30;  
                             const double tmp14_1 = C_0_2*w28;  
                             const double tmp19_1 = C_0_3*w31;  
                             const double tmp22_1 = C_1_0*w40;  
                             const double tmp37_1 = tmp3_0*w35;  
                             const double tmp29_1 = C_0_1*w35;  
                             const double tmp73_1 = C_0_2*w37;  
                             const double tmp74_1 = C_1_2*w41;  
                             const double tmp52_1 = C_1_3*w39;  
                             const double tmp25_1 = C_1_1*w39;  
                             const double tmp62_1 = C_0_1*w31;  
                             const double tmp79_1 = C_1_1*w40;  
                             const double tmp43_1 = C_1_1*w36;  
                             const double tmp27_1 = C_0_3*w38;  
                             const double tmp28_1 = C_1_0*w42;  
                             const double tmp63_1 = C_1_1*w42;  
                             const double tmp59_1 = C_0_3*w34;  
                             const double tmp72_1 = C_1_3*w29;  
                             const double tmp40_1 = tmp2_0*w35;  
                             const double tmp13_1 = C_0_3*w30;  
                             const double tmp51_1 = C_1_2*w40;  
                             const double tmp54_1 = C_1_2*w42;  
                             const double tmp12_1 = C_0_0*w31;  
                             const double tmp2_1 = tmp1_0*w32;  
                             const double tmp68_1 = C_0_2*w31;  
                             const double tmp75_1 = C_1_0*w32;  
                             const double tmp49_1 = C_1_1*w41;  
                             const double tmp4_1 = C_0_2*w35;  
                             const double tmp66_1 = C_0_3*w28;  
                             const double tmp56_1 = C_0_1*w37;  
                             const double tmp5_1 = C_0_1*w34;  
                             const double tmp38_1 = tmp2_0*w34;  
                             const double tmp76_1 = C_0_1*w38;  
                             const double tmp21_1 = C_0_1*w28;  
                             const double tmp69_1 = C_0_1*w30;  
                             const double tmp53_1 = C_1_0*w36;  
                             const double tmp42_1 = C_1_2*w39;  
                             const double tmp32_1 = tmp1_0*w29;  
                             const double tmp45_1 = C_1_0*w43;  
                             const double tmp33_1 = tmp0_0*w32;  
                             const double tmp35_1 = C_1_0*w41;  
                             const double tmp26_1 = C_1_2*w36;  
                             const double tmp67_1 = C_0_0*w33;  
                             const double tmp31_1 = C_0_2*w34;  
                             const double tmp20_1 = C_0_0*w30;  
                             const double tmp70_1 = C_0_0*w28;  
                             const double tmp8_1 = tmp0_0*w39;  
                             const double tmp30_1 = C_1_3*w43;  
                             const double tmp0_1 = tmp0_0*w29;  
                             const double tmp17_1 = C_1_3*w41;  
                             const double tmp58_1 = C_0_0*w35;  
                             const double tmp9_1 = tmp3_0*w33;  
                             const double tmp61_1 = C_1_3*w36;  
                             const double tmp41_1 = tmp3_0*w34;  
                             const double tmp50_1 = C_1_3*w32;  
                             const double tmp18_1 = C_1_1*w32;  
                             const double tmp6_1 = tmp1_0*w36;  
                             const double tmp3_1 = C_0_0*w38;  
                             const double tmp34_1 = C_1_1*w29;  
                             const double tmp77_1 = C_0_3*w35;  
                             const double tmp65_1 = C_1_2*w43;  
                             const double tmp71_1 = C_0_3*w33;  
                             const double tmp55_1 = C_1_1*w43;  
                             const double tmp46_1 = tmp3_0*w28;  
                             const double tmp24_1 = C_0_0*w37;  
                             const double tmp10_1 = tmp1_0*w39;  
                             const double tmp48_1 = C_1_0*w29;  
                             const double tmp15_1 = C_0_1*w33;  
                             const double tmp36_1 = C_1_2*w32;  
                             const double tmp60_1 = C_1_0*w39;  
                             const double tmp47_1 = tmp2_0*w33;  
                             const double tmp16_1 = C_1_2*w29;  
                             const double tmp1_1 = C_0_3*w37;  
                             const double tmp7_1 = tmp2_0*w28;  
                             const double tmp39_1 = C_1_3*w40;  
                             const double tmp44_1 = C_1_3*w42;  
                             const double tmp57_1 = C_0_2*w38;  
                             const double tmp78_1 = C_0_0*w34;  
                             const double tmp11_1 = tmp0_0*w36;  
                             const double tmp23_1 = C_0_2*w33;  
                             EM_S[INDEX2(0,0,4)]+=tmp16_1 + tmp17_1 + tmp18_1 + tmp19_1 + tmp20_1 + tmp21_1 + tmp22_1 + tmp23_1;  
                             EM_S[INDEX2(1,0,4)]+=tmp0_1 + tmp2_1 + tmp68_1 + tmp69_1 + tmp70_1 + tmp71_1;  
                             EM_S[INDEX2(2,0,4)]+=tmp46_1 + tmp47_1 + tmp48_1 + tmp49_1 + tmp50_1 + tmp51_1;  
                             EM_S[INDEX2(3,0,4)]+=tmp32_1 + tmp33_1 + tmp7_1 + tmp9_1;  
                             EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1 + tmp4_1 + tmp5_1;  
                             EM_S[INDEX2(1,1,4)]+=tmp72_1 + tmp73_1 + tmp74_1 + tmp75_1 + tmp76_1 + tmp77_1 + tmp78_1 + tmp79_1;  
                             EM_S[INDEX2(2,1,4)]+=tmp32_1 + tmp33_1 + tmp40_1 + tmp41_1;  
                             EM_S[INDEX2(3,1,4)]+=tmp34_1 + tmp35_1 + tmp36_1 + tmp37_1 + tmp38_1 + tmp39_1;  
                             EM_S[INDEX2(0,2,4)]+=tmp42_1 + tmp43_1 + tmp44_1 + tmp45_1 + tmp46_1 + tmp47_1;  
                             EM_S[INDEX2(1,2,4)]+=tmp6_1 + tmp7_1 + tmp8_1 + tmp9_1;  
                             EM_S[INDEX2(2,2,4)]+=tmp60_1 + tmp61_1 + tmp62_1 + tmp63_1 + tmp64_1 + tmp65_1 + tmp66_1 + tmp67_1;  
                             EM_S[INDEX2(3,2,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1 + tmp14_1 + tmp15_1;  
                             EM_S[INDEX2(0,3,4)]+=tmp40_1 + tmp41_1 + tmp6_1 + tmp8_1;  
                             EM_S[INDEX2(1,3,4)]+=tmp37_1 + tmp38_1 + tmp52_1 + tmp53_1 + tmp54_1 + tmp55_1;  
                             EM_S[INDEX2(2,3,4)]+=tmp10_1 + tmp11_1 + tmp56_1 + tmp57_1 + tmp58_1 + tmp59_1;  
                             EM_S[INDEX2(3,3,4)]+=tmp24_1 + tmp25_1 + tmp26_1 + tmp27_1 + tmp28_1 + tmp29_1 + tmp30_1 + tmp31_1;  
                         } else { // constant data  
                             const double C_0 = C_p[0];  
                             const double C_1 = C_p[1];  
                             const double tmp0_1 = C_0*w47;  
                             const double tmp1_1 = C_1*w45;  
                             const double tmp2_1 = C_1*w48;  
                             const double tmp3_1 = C_0*w51;  
                             const double tmp4_1 = C_0*w44;  
                             const double tmp5_1 = C_1*w49;  
                             const double tmp6_1 = C_1*w50;  
                             const double tmp7_1 = C_0*w46;  
                             EM_S[INDEX2(0,0,4)]+=tmp4_1 + tmp5_1;  
                             EM_S[INDEX2(1,0,4)]+=tmp1_1 + tmp4_1;  
                             EM_S[INDEX2(2,0,4)]+=tmp3_1 + tmp5_1;  
                             EM_S[INDEX2(3,0,4)]+=tmp1_1 + tmp3_1;  
                             EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1;  
                             EM_S[INDEX2(1,1,4)]+=tmp0_1 + tmp5_1;  
                             EM_S[INDEX2(2,1,4)]+=tmp1_1 + tmp7_1;  
                             EM_S[INDEX2(3,1,4)]+=tmp5_1 + tmp7_1;  
                             EM_S[INDEX2(0,2,4)]+=tmp3_1 + tmp6_1;  
                             EM_S[INDEX2(1,2,4)]+=tmp2_1 + tmp3_1;  
                             EM_S[INDEX2(2,2,4)]+=tmp4_1 + tmp6_1;  
                             EM_S[INDEX2(3,2,4)]+=tmp2_1 + tmp4_1;  
                             EM_S[INDEX2(0,3,4)]+=tmp2_1 + tmp7_1;  
                             EM_S[INDEX2(1,3,4)]+=tmp6_1 + tmp7_1;  
                             EM_S[INDEX2(2,3,4)]+=tmp0_1 + tmp2_1;  
                             EM_S[INDEX2(3,3,4)]+=tmp0_1 + tmp6_1;  
                         }  
                     }  
                     ///////////////  
                     // process D //  
                     ///////////////  
                     if (!D.isEmpty()) {  
                         add_EM_S=true;  
                         const double* D_p=const_cast<escript::Data*>(&D)->getSampleDataRO(e);  
                         if (D.actsExpanded()) {  
                             const double D_0 = D_p[0];  
                             const double D_1 = D_p[1];  
                             const double D_2 = D_p[2];  
                             const double D_3 = D_p[3];  
                             const double tmp0_0 = D_0 + D_1;  
                             const double tmp1_0 = D_2 + D_3;  
                             const double tmp2_0 = D_0 + D_1 + D_2 + D_3;  
                             const double tmp3_0 = D_1 + D_2;  
                             const double tmp4_0 = D_1 + D_3;  
                             const double tmp5_0 = D_0 + D_2;  
                             const double tmp6_0 = D_0 + D_3;  
                             const double tmp0_1 = tmp0_0*w52;  
                             const double tmp1_1 = tmp1_0*w53;  
                             const double tmp2_1 = tmp2_0*w54;  
                             const double tmp3_1 = tmp1_0*w52;  
                             const double tmp4_1 = tmp0_0*w53;  
                             const double tmp5_1 = tmp3_0*w54;  
                             const double tmp6_1 = D_0*w55;  
                             const double tmp7_1 = D_3*w56;  
                             const double tmp8_1 = D_3*w55;  
                             const double tmp9_1 = D_0*w56;  
                             const double tmp10_1 = tmp4_0*w52;  
                             const double tmp11_1 = tmp5_0*w53;  
                             const double tmp12_1 = tmp5_0*w52;  
                             const double tmp13_1 = tmp4_0*w53;  
                             const double tmp14_1 = tmp6_0*w54;  
                             const double tmp15_1 = D_2*w55;  
                             const double tmp16_1 = D_1*w56;  
                             const double tmp17_1 = D_1*w55;  
                             const double tmp18_1 = D_2*w56;  
                             EM_S[INDEX2(0,0,4)]+=tmp5_1 + tmp6_1 + tmp7_1;  
                             EM_S[INDEX2(1,0,4)]+=tmp0_1 + tmp1_1;  
                             EM_S[INDEX2(2,0,4)]+=tmp12_1 + tmp13_1;  
                             EM_S[INDEX2(3,0,4)]+=tmp2_1;  
                             EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1;  
                             EM_S[INDEX2(1,1,4)]+=tmp14_1 + tmp17_1 + tmp18_1;  
                             EM_S[INDEX2(2,1,4)]+=tmp2_1;  
                             EM_S[INDEX2(3,1,4)]+=tmp10_1 + tmp11_1;  
                             EM_S[INDEX2(0,2,4)]+=tmp12_1 + tmp13_1;  
                             EM_S[INDEX2(1,2,4)]+=tmp2_1;  
                             EM_S[INDEX2(2,2,4)]+=tmp14_1 + tmp15_1 + tmp16_1;  
                             EM_S[INDEX2(3,2,4)]+=tmp3_1 + tmp4_1;  
                             EM_S[INDEX2(0,3,4)]+=tmp2_1;  
                             EM_S[INDEX2(1,3,4)]+=tmp10_1 + tmp11_1;  
                             EM_S[INDEX2(2,3,4)]+=tmp3_1 + tmp4_1;  
                             EM_S[INDEX2(3,3,4)]+=tmp5_1 + tmp8_1 + tmp9_1;  
                         } else { // constant data  
                             const double tmp0_1 = D_p[0]*w57;  
                             const double tmp1_1 = D_p[0]*w58;  
                             const double tmp2_1 = D_p[0]*w59;  
                             EM_S[INDEX2(0,0,4)]+=tmp2_1;  
                             EM_S[INDEX2(1,0,4)]+=tmp0_1;  
                             EM_S[INDEX2(2,0,4)]+=tmp0_1;  
                             EM_S[INDEX2(3,0,4)]+=tmp1_1;  
                             EM_S[INDEX2(0,1,4)]+=tmp0_1;  
                             EM_S[INDEX2(1,1,4)]+=tmp2_1;  
                             EM_S[INDEX2(2,1,4)]+=tmp1_1;  
                             EM_S[INDEX2(3,1,4)]+=tmp0_1;  
                             EM_S[INDEX2(0,2,4)]+=tmp0_1;  
                             EM_S[INDEX2(1,2,4)]+=tmp1_1;  
                             EM_S[INDEX2(2,2,4)]+=tmp2_1;  
                             EM_S[INDEX2(3,2,4)]+=tmp0_1;  
                             EM_S[INDEX2(0,3,4)]+=tmp1_1;  
                             EM_S[INDEX2(1,3,4)]+=tmp0_1;  
                             EM_S[INDEX2(2,3,4)]+=tmp0_1;  
                             EM_S[INDEX2(3,3,4)]+=tmp2_1;  
                         }  
                     }  
                     ///////////////  
                     // process X //  
                     ///////////////  
                     if (!X.isEmpty()) {  
                         add_EM_F=true;  
                         const double* X_p=const_cast<escript::Data*>(&X)->getSampleDataRO(e);  
                         if (X.actsExpanded()) {  
                             const double X_0_0 = X_p[INDEX2(0,0,2)];  
                             const double X_1_0 = X_p[INDEX2(1,0,2)];  
                             const double X_0_1 = X_p[INDEX2(0,1,2)];  
                             const double X_1_1 = X_p[INDEX2(1,1,2)];  
                             const double X_0_2 = X_p[INDEX2(0,2,2)];  
                             const double X_1_2 = X_p[INDEX2(1,2,2)];  
                             const double X_0_3 = X_p[INDEX2(0,3,2)];  
                             const double X_1_3 = X_p[INDEX2(1,3,2)];  
                             const double tmp0_0 = X_0_2 + X_0_3;  
                             const double tmp1_0 = X_1_1 + X_1_3;  
                             const double tmp2_0 = X_1_0 + X_1_2;  
                             const double tmp3_0 = X_0_0 + X_0_1;  
                             const double tmp0_1 = tmp0_0*w63;  
                             const double tmp1_1 = tmp1_0*w62;  
                             const double tmp2_1 = tmp2_0*w61;  
                             const double tmp3_1 = tmp3_0*w60;  
                             const double tmp4_1 = tmp0_0*w65;  
                             const double tmp5_1 = tmp3_0*w64;  
                             const double tmp6_1 = tmp2_0*w62;  
                             const double tmp7_1 = tmp1_0*w61;  
                             const double tmp8_1 = tmp2_0*w66;  
                             const double tmp9_1 = tmp3_0*w63;  
                             const double tmp10_1 = tmp0_0*w60;  
                             const double tmp11_1 = tmp1_0*w67;  
                             const double tmp12_1 = tmp1_0*w66;  
                             const double tmp13_1 = tmp3_0*w65;  
                             const double tmp14_1 = tmp0_0*w64;  
                             const double tmp15_1 = tmp2_0*w67;  
                             EM_F[0]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                             EM_F[1]+=tmp4_1 + tmp5_1 + tmp6_1 + tmp7_1;  
                             EM_F[2]+=tmp10_1 + tmp11_1 + tmp8_1 + tmp9_1;  
                             EM_F[3]+=tmp12_1 + tmp13_1 + tmp14_1 + tmp15_1;  
                         } else { // constant data  
                             const double tmp0_1 = X_p[1]*w69;  
                             const double tmp1_1 = X_p[0]*w68;  
                             const double tmp2_1 = X_p[0]*w70;  
                             const double tmp3_1 = X_p[1]*w71;  
                             EM_F[0]+=tmp0_1 + tmp1_1;  
                             EM_F[1]+=tmp0_1 + tmp2_1;  
                             EM_F[2]+=tmp1_1 + tmp3_1;  
                             EM_F[3]+=tmp2_1 + tmp3_1;  
                         }  
                     }  
                     ///////////////  
                     // process Y //  
                     ///////////////  
                     if (!Y.isEmpty()) {  
                         add_EM_F=true;  
                         const double* Y_p=const_cast<escript::Data*>(&Y)->getSampleDataRO(e);  
                         if (Y.actsExpanded()) {  
                             const double Y_0 = Y_p[0];  
                             const double Y_1 = Y_p[1];  
                             const double Y_2 = Y_p[2];  
                             const double Y_3 = Y_p[3];  
                             const double tmp0_0 = Y_1 + Y_2;  
                             const double tmp1_0 = Y_0 + Y_3;  
                             const double tmp0_1 = Y_0*w72;  
                             const double tmp1_1 = tmp0_0*w73;  
                             const double tmp2_1 = Y_3*w74;  
                             const double tmp3_1 = Y_1*w72;  
                             const double tmp4_1 = tmp1_0*w73;  
                             const double tmp5_1 = Y_2*w74;  
                             const double tmp6_1 = Y_2*w72;  
                             const double tmp7_1 = Y_1*w74;  
                             const double tmp8_1 = Y_3*w72;  
                             const double tmp9_1 = Y_0*w74;  
                             EM_F[0]+=tmp0_1 + tmp1_1 + tmp2_1;  
                             EM_F[1]+=tmp3_1 + tmp4_1 + tmp5_1;  
                             EM_F[2]+=tmp4_1 + tmp6_1 + tmp7_1;  
                             EM_F[3]+=tmp1_1 + tmp8_1 + tmp9_1;  
                         } else { // constant data  
                             const double tmp0_1 = Y_p[0]*w75;  
                             EM_F[0]+=tmp0_1;  
                             EM_F[1]+=tmp0_1;  
                             EM_F[2]+=tmp0_1;  
                             EM_F[3]+=tmp0_1;  
                         }  
                     }  
1879    
1880                      // add to matrix (if add_EM_S) and RHS (if add_EM_F)  namespace
1881                      const index_t firstNode=m_N0*k1+k0;  {
1882                      addToMatrixAndRHS(mat, rhs, EM_S, EM_F, add_EM_S, add_EM_F, firstNode);      // Calculates a guassian blur colvolution matrix for 2D
1883                  } // end k0 loop      // See wiki article on the subject    
1884              } // end k1 loop      double* get2DGauss(unsigned radius, double sigma)
1885          } // end of colouring      {
1886      } // end of parallel region          double* arr=new double[(radius*2+1)*(radius*2+1)];
1887            double common=M_1_PI*0.5*1/(sigma*sigma);
1888            double total=0;
1889            int r=static_cast<int>(radius);
1890            for (int y=-r;y<=r;++y)
1891            {
1892                for (int x=-r;x<=r;++x)
1893                {        
1894                    arr[(x+r)+(y+r)*(r*2+1)]=common*exp(-(x*x+y*y)/(2*sigma*sigma));
1895                    total+=arr[(x+r)+(y+r)*(r*2+1)];
1896                }
1897            }
1898            double invtotal=1/total;
1899            for (size_t p=0;p<(radius*2+1)*(radius*2+1);++p)
1900            {
1901                arr[p]*=invtotal;
1902            }
1903            return arr;
1904        }
1905        
1906        // applies conv to source to get a point.
1907        // (xp, yp) are the coords in the source matrix not the destination matrix
1908        double Convolve2D(double* conv, double* source, size_t xp, size_t yp, unsigned radius, size_t width)
1909        {
1910            size_t bx=xp-radius, by=yp-radius;
1911            size_t sbase=bx+by*width;
1912            double result=0;
1913            for (int y=0;y<2*radius+1;++y)
1914            {        
1915                for (int x=0;x<2*radius+1;++x)
1916                {
1917                    result+=conv[x+y*(2*radius+1)] * source[sbase + x+y*width];
1918                }
1919            }
1920            return result;      
1921        }
1922  }  }
1923    
 //protected  
 void Rectangle::assemblePDESingleReduced(Paso_SystemMatrix* mat,  
         escript::Data& rhs, const escript::Data& A, const escript::Data& B,  
         const escript::Data& C, const escript::Data& D,  
         const escript::Data& X, const escript::Data& Y) const  
 {  
     const double h0 = m_l0/m_gNE0;  
     const double h1 = m_l1/m_gNE1;  
     const double w0 = -.25*h1/h0;  
     const double w1 = .25;  
     const double w2 = -.25;  
     const double w3 = .25*h0/h1;  
     const double w4 = -.25*h0/h1;  
     const double w5 = .25*h1/h0;  
     const double w6 = -.125*h1;  
     const double w7 = -.125*h0;  
     const double w8 = .125*h1;  
     const double w9 = .125*h0;  
     const double w10 = .0625*h0*h1;  
     const double w11 = -.5*h1;  
     const double w12 = -.5*h0;  
     const double w13 = .5*h1;  
     const double w14 = .5*h0;  
     const double w15 = .25*h0*h1;  
1924    
1925      rhs.requireWrite();  /* This is a wrapper for filtered (and non-filtered) randoms
1926  #pragma omp parallel   * For detailed doco see randomFillWorker
1927    */
1928    escript::Data Rectangle::randomFill(const escript::DataTypes::ShapeType& shape,
1929           const escript::FunctionSpace& what,
1930           long seed, const boost::python::tuple& filter) const
1931    {
1932        int numvals=escript::DataTypes::noValues(shape);
1933        if (len(filter)>0 && (numvals!=1))
1934      {      {
1935          for (index_t k1_0=0; k1_0<2; k1_0++) { // colouring          throw RipleyException("Ripley only supports filters for scalar data.");
1936  #pragma omp for      }
1937              for (index_t k1=k1_0; k1<m_NE1; k1+=2) {      escript::Data res=randomFillWorker(shape, seed, filter);
1938                  for (index_t k0=0; k0<m_NE0; ++k0)  {      if (res.getFunctionSpace()!=what)
1939                      bool add_EM_S=false;      {
1940                      bool add_EM_F=false;          escript::Data r=escript::Data(res, what);
1941                      vector<double> EM_S(4*4, 0);          return r;
1942                      vector<double> EM_F(4, 0);      }
1943                      const index_t e = k0 + m_NE0*k1;      return res;
                     ///////////////  
                     // process A //  
                     ///////////////  
                     if (!A.isEmpty()) {  
                         add_EM_S=true;  
                         const double* A_p=const_cast<escript::Data*>(&A)->getSampleDataRO(e);  
                         const double A_00 = A_p[INDEX2(0,0,2)];  
                         const double A_10 = A_p[INDEX2(1,0,2)];  
                         const double A_01 = A_p[INDEX2(0,1,2)];  
                         const double A_11 = A_p[INDEX2(1,1,2)];  
                         const double tmp0_0 = A_01 + A_10;  
                         const double tmp0_1 = A_11*w3;  
                         const double tmp1_1 = A_00*w0;  
                         const double tmp2_1 = A_01*w1;  
                         const double tmp3_1 = A_10*w2;  
                         const double tmp4_1 = tmp0_0*w1;  
                         const double tmp5_1 = A_11*w4;  
                         const double tmp6_1 = A_00*w5;  
                         const double tmp7_1 = tmp0_0*w2;  
                         const double tmp8_1 = A_10*w1;  
                         const double tmp9_1 = A_01*w2;  
                         EM_S[INDEX2(0,0,4)]+=tmp0_1 + tmp4_1 + tmp6_1;  
                         EM_S[INDEX2(1,0,4)]+=tmp0_1 + tmp1_1 + tmp8_1 + tmp9_1;  
                         EM_S[INDEX2(2,0,4)]+=tmp2_1 + tmp3_1 + tmp5_1 + tmp6_1;  
                         EM_S[INDEX2(3,0,4)]+=tmp1_1 + tmp5_1 + tmp7_1;  
                         EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                         EM_S[INDEX2(1,1,4)]+=tmp0_1 + tmp6_1 + tmp7_1;  
                         EM_S[INDEX2(2,1,4)]+=tmp1_1 + tmp4_1 + tmp5_1;  
                         EM_S[INDEX2(3,1,4)]+=tmp5_1 + tmp6_1 + tmp8_1 + tmp9_1;  
                         EM_S[INDEX2(0,2,4)]+=tmp5_1 + tmp6_1 + tmp8_1 + tmp9_1;  
                         EM_S[INDEX2(1,2,4)]+=tmp1_1 + tmp4_1 + tmp5_1;  
                         EM_S[INDEX2(2,2,4)]+=tmp0_1 + tmp6_1 + tmp7_1;  
                         EM_S[INDEX2(3,2,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                         EM_S[INDEX2(0,3,4)]+=tmp1_1 + tmp5_1 + tmp7_1;  
                         EM_S[INDEX2(1,3,4)]+=tmp2_1 + tmp3_1 + tmp5_1 + tmp6_1;  
                         EM_S[INDEX2(2,3,4)]+=tmp0_1 + tmp1_1 + tmp8_1 + tmp9_1;  
                         EM_S[INDEX2(3,3,4)]+=tmp0_1 + tmp4_1 + tmp6_1;  
                     }  
                     ///////////////  
                     // process B //  
                     ///////////////  
                     if (!B.isEmpty()) {  
                         add_EM_S=true;  
                         const double* B_p=const_cast<escript::Data*>(&B)->getSampleDataRO(e);  
                         const double tmp2_1 = B_p[0]*w8;  
                         const double tmp0_1 = B_p[0]*w6;  
                         const double tmp3_1 = B_p[1]*w9;  
                         const double tmp1_1 = B_p[1]*w7;  
                         EM_S[INDEX2(0,0,4)]+=tmp0_1 + tmp1_1;  
                         EM_S[INDEX2(1,0,4)]+=tmp1_1 + tmp2_1;  
                         EM_S[INDEX2(2,0,4)]+=tmp0_1 + tmp3_1;  
                         EM_S[INDEX2(3,0,4)]+=tmp2_1 + tmp3_1;  
                         EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1;  
                         EM_S[INDEX2(1,1,4)]+=tmp1_1 + tmp2_1;  
                         EM_S[INDEX2(2,1,4)]+=tmp0_1 + tmp3_1;  
                         EM_S[INDEX2(3,1,4)]+=tmp2_1 + tmp3_1;  
                         EM_S[INDEX2(0,2,4)]+=tmp0_1 + tmp1_1;  
                         EM_S[INDEX2(1,2,4)]+=tmp1_1 + tmp2_1;  
                         EM_S[INDEX2(2,2,4)]+=tmp0_1 + tmp3_1;  
                         EM_S[INDEX2(3,2,4)]+=tmp2_1 + tmp3_1;  
                         EM_S[INDEX2(0,3,4)]+=tmp0_1 + tmp1_1;  
                         EM_S[INDEX2(1,3,4)]+=tmp1_1 + tmp2_1;  
                         EM_S[INDEX2(2,3,4)]+=tmp0_1 + tmp3_1;  
                         EM_S[INDEX2(3,3,4)]+=tmp2_1 + tmp3_1;  
                     }  
                     ///////////////  
                     // process C //  
                     ///////////////  
                     if (!C.isEmpty()) {  
                         add_EM_S=true;  
                         const double* C_p=const_cast<escript::Data*>(&C)->getSampleDataRO(e);  
                         const double tmp1_1 = C_p[1]*w7;  
                         const double tmp0_1 = C_p[0]*w8;  
                         const double tmp3_1 = C_p[0]*w6;  
                         const double tmp2_1 = C_p[1]*w9;  
                         EM_S[INDEX2(0,0,4)]+=tmp1_1 + tmp3_1;  
                         EM_S[INDEX2(1,0,4)]+=tmp1_1 + tmp3_1;  
                         EM_S[INDEX2(2,0,4)]+=tmp1_1 + tmp3_1;  
                         EM_S[INDEX2(3,0,4)]+=tmp1_1 + tmp3_1;  
                         EM_S[INDEX2(0,1,4)]+=tmp0_1 + tmp1_1;  
                         EM_S[INDEX2(1,1,4)]+=tmp0_1 + tmp1_1;  
                         EM_S[INDEX2(2,1,4)]+=tmp0_1 + tmp1_1;  
                         EM_S[INDEX2(3,1,4)]+=tmp0_1 + tmp1_1;  
                         EM_S[INDEX2(0,2,4)]+=tmp2_1 + tmp3_1;  
                         EM_S[INDEX2(1,2,4)]+=tmp2_1 + tmp3_1;  
                         EM_S[INDEX2(2,2,4)]+=tmp2_1 + tmp3_1;  
                         EM_S[INDEX2(3,2,4)]+=tmp2_1 + tmp3_1;  
                         EM_S[INDEX2(0,3,4)]+=tmp0_1 + tmp2_1;  
                         EM_S[INDEX2(1,3,4)]+=tmp0_1 + tmp2_1;  
                         EM_S[INDEX2(2,3,4)]+=tmp0_1 + tmp2_1;  
                         EM_S[INDEX2(3,3,4)]+=tmp0_1 + tmp2_1;  
                     }  
                     ///////////////  
                     // process D //  
                     ///////////////  
                     if (!D.isEmpty()) {  
                         add_EM_S=true;  
                         const double* D_p=const_cast<escript::Data*>(&D)->getSampleDataRO(e);  
                         const double tmp0_1 = D_p[0]*w10;  
                         EM_S[INDEX2(0,0,4)]+=tmp0_1;  
                         EM_S[INDEX2(1,0,4)]+=tmp0_1;  
                         EM_S[INDEX2(2,0,4)]+=tmp0_1;  
                         EM_S[INDEX2(3,0,4)]+=tmp0_1;  
                         EM_S[INDEX2(0,1,4)]+=tmp0_1;  
                         EM_S[INDEX2(1,1,4)]+=tmp0_1;  
                         EM_S[INDEX2(2,1,4)]+=tmp0_1;  
                         EM_S[INDEX2(3,1,4)]+=tmp0_1;  
                         EM_S[INDEX2(0,2,4)]+=tmp0_1;  
                         EM_S[INDEX2(1,2,4)]+=tmp0_1;  
                         EM_S[INDEX2(2,2,4)]+=tmp0_1;  
                         EM_S[INDEX2(3,2,4)]+=tmp0_1;  
                         EM_S[INDEX2(0,3,4)]+=tmp0_1;  
                         EM_S[INDEX2(1,3,4)]+=tmp0_1;  
                         EM_S[INDEX2(2,3,4)]+=tmp0_1;  
                         EM_S[INDEX2(3,3,4)]+=tmp0_1;  
                     }  
                     ///////////////  
                     // process X //  
                     ///////////////  
                     if (!X.isEmpty()) {  
                         add_EM_F=true;  
                         const double* X_p=const_cast<escript::Data*>(&X)->getSampleDataRO(e);  
                         const double tmp0_1 = X_p[0]*w11;  
                         const double tmp2_1 = X_p[0]*w13;  
                         const double tmp1_1 = X_p[1]*w12;  
                         const double tmp3_1 = X_p[1]*w14;  
                         EM_F[0]+=tmp0_1 + tmp1_1;  
                         EM_F[1]+=tmp1_1 + tmp2_1;  
                         EM_F[2]+=tmp0_1 + tmp3_1;  
                         EM_F[3]+=tmp2_1 + tmp3_1;  
                     }  
                     ///////////////  
                     // process Y //  
                     ///////////////  
                     if (!Y.isEmpty()) {  
                         add_EM_F=true;  
                         const double* Y_p=const_cast<escript::Data*>(&Y)->getSampleDataRO(e);  
                         const double tmp0_1 = Y_p[0]*w15;  
                         EM_F[0]+=tmp0_1;  
                         EM_F[1]+=tmp0_1;  
                         EM_F[2]+=tmp0_1;  
                         EM_F[3]+=tmp0_1;  
                     }  
   
                     // add to matrix (if add_EM_S) and RHS (if add_EM_F)  
                     const index_t firstNode=m_N0*k1+k0;  
                     addToMatrixAndRHS(mat, rhs, EM_S, EM_F, add_EM_S, add_EM_F, firstNode);  
                 } // end k0 loop  
             } // end k1 loop  
         } // end of colouring  
     } // end of parallel region  
1944  }  }
1945    
 //protected  
 void Rectangle::assemblePDESystem(Paso_SystemMatrix* mat,  
         escript::Data& rhs, const escript::Data& A, const escript::Data& B,  
         const escript::Data& C, const escript::Data& D,  
         const escript::Data& X, const escript::Data& Y) const  
 {  
     const double h0 = m_l0/m_gNE0;  
     const double h1 = m_l1/m_gNE1;  
     dim_t numEq, numComp;  
     if (!mat)  
         numEq=numComp=(rhs.isEmpty() ? 1 : rhs.getDataPointSize());  
     else {  
         numEq=mat->logical_row_block_size;  
         numComp=mat->logical_col_block_size;  
     }  
   
     const double w0 = -0.1555021169820365539*h1/h0;  
     const double w1 = 0.041666666666666666667;  
     const double w2 = -0.15550211698203655390;  
     const double w3 = 0.041666666666666666667*h0/h1;  
     const double w4 = 0.15550211698203655390;  
     const double w5 = -0.041666666666666666667;  
     const double w6 = -0.01116454968463011277*h1/h0;  
     const double w7 = 0.011164549684630112770;  
     const double w8 = -0.011164549684630112770;  
     const double w9 = -0.041666666666666666667*h1/h0;  
     const double w10 = -0.041666666666666666667*h0/h1;  
     const double w11 = 0.1555021169820365539*h1/h0;  
     const double w12 = 0.1555021169820365539*h0/h1;  
     const double w13 = 0.01116454968463011277*h0/h1;  
     const double w14 = 0.01116454968463011277*h1/h0;  
     const double w15 = 0.041666666666666666667*h1/h0;  
     const double w16 = -0.01116454968463011277*h0/h1;  
     const double w17 = -0.1555021169820365539*h0/h1;  
     const double w18 = -0.33333333333333333333*h1/h0;  
     const double w19 = 0.25000000000000000000;  
     const double w20 = -0.25000000000000000000;  
     const double w21 = 0.16666666666666666667*h0/h1;  
     const double w22 = -0.16666666666666666667*h1/h0;  
     const double w23 = -0.16666666666666666667*h0/h1;  
     const double w24 = 0.33333333333333333333*h1/h0;  
     const double w25 = 0.33333333333333333333*h0/h1;  
     const double w26 = 0.16666666666666666667*h1/h0;  
     const double w27 = -0.33333333333333333333*h0/h1;  
     const double w28 = -0.032861463941450536761*h1;  
     const double w29 = -0.032861463941450536761*h0;  
     const double w30 = -0.12264065304058601714*h1;  
     const double w31 = -0.0023593469594139828636*h1;  
     const double w32 = -0.008805202725216129906*h0;  
     const double w33 = -0.008805202725216129906*h1;  
     const double w34 = 0.032861463941450536761*h1;  
     const double w35 = 0.008805202725216129906*h1;  
     const double w36 = 0.008805202725216129906*h0;  
     const double w37 = 0.0023593469594139828636*h1;  
     const double w38 = 0.12264065304058601714*h1;  
     const double w39 = 0.032861463941450536761*h0;  
     const double w40 = -0.12264065304058601714*h0;  
     const double w41 = -0.0023593469594139828636*h0;  
     const double w42 = 0.0023593469594139828636*h0;  
     const double w43 = 0.12264065304058601714*h0;  
     const double w44 = -0.16666666666666666667*h1;  
     const double w45 = -0.083333333333333333333*h0;  
     const double w46 = 0.083333333333333333333*h1;  
     const double w47 = 0.16666666666666666667*h1;  
     const double w48 = 0.083333333333333333333*h0;  
     const double w49 = -0.16666666666666666667*h0;  
     const double w50 = 0.16666666666666666667*h0;  
     const double w51 = -0.083333333333333333333*h1;  
     const double w52 = 0.025917019497006092316*h0*h1;  
     const double w53 = 0.0018607582807716854616*h0*h1;  
     const double w54 = 0.0069444444444444444444*h0*h1;  
     const double w55 = 0.09672363354357992482*h0*h1;  
     const double w56 = 0.00049858867864229740201*h0*h1;  
     const double w57 = 0.055555555555555555556*h0*h1;  
     const double w58 = 0.027777777777777777778*h0*h1;  
     const double w59 = 0.11111111111111111111*h0*h1;  
     const double w60 = -0.19716878364870322056*h1;  
     const double w61 = -0.19716878364870322056*h0;  
     const double w62 = -0.052831216351296779436*h0;  
     const double w63 = -0.052831216351296779436*h1;  
     const double w64 = 0.19716878364870322056*h1;  
     const double w65 = 0.052831216351296779436*h1;  
     const double w66 = 0.19716878364870322056*h0;  
     const double w67 = 0.052831216351296779436*h0;  
     const double w68 = -0.5*h1;  
     const double w69 = -0.5*h0;  
     const double w70 = 0.5*h1;  
     const double w71 = 0.5*h0;  
     const double w72 = 0.1555021169820365539*h0*h1;  
     const double w73 = 0.041666666666666666667*h0*h1;  
     const double w74 = 0.01116454968463011277*h0*h1;  
     const double w75 = 0.25*h0*h1;  
1946    
1947      rhs.requireWrite();  /* This routine produces a Data object filled with smoothed random data.
1948  #pragma omp parallel  The dimensions of the rectangle being filled are internal[0] x internal[1] points.
1949      {  A parameter radius  gives the size of the stencil used for the smoothing.
1950          for (index_t k1_0=0; k1_0<2; k1_0++) { // colouring  A point on the left hand edge for example, will still require `radius` extra points to the left
1951  #pragma omp for  in order to complete the stencil.
             for (index_t k1=k1_0; k1<m_NE1; k1+=2) {  
                 for (index_t k0=0; k0<m_NE0; ++k0)  {  
                     bool add_EM_S=false;  
                     bool add_EM_F=false;  
                     vector<double> EM_S(4*4*numEq*numComp, 0);  
                     vector<double> EM_F(4*numEq, 0);  
                     const index_t e = k0 + m_NE0*k1;  
                     ///////////////  
                     // process A //  
                     ///////////////  
                     if (!A.isEmpty()) {  
                         add_EM_S=true;  
                         const double* A_p=const_cast<escript::Data*>(&A)->getSampleDataRO(e);  
                         if (A.actsExpanded()) {  
                             for (index_t k=0; k<numEq; k++) {  
                                 for (index_t m=0; m<numComp; m++) {  
                                     const double A_00_0 = A_p[INDEX5(k,0,m,0,0, numEq,2,numComp,2)];  
                                     const double A_01_0 = A_p[INDEX5(k,0,m,1,0, numEq,2,numComp,2)];  
                                     const double A_10_0 = A_p[INDEX5(k,1,m,0,0, numEq,2,numComp,2)];  
                                     const double A_11_0 = A_p[INDEX5(k,1,m,1,0, numEq,2,numComp,2)];  
                                     const double A_00_1 = A_p[INDEX5(k,0,m,0,1, numEq,2,numComp,2)];  
                                     const double A_01_1 = A_p[INDEX5(k,0,m,1,1, numEq,2,numComp,2)];  
                                     const double A_10_1 = A_p[INDEX5(k,1,m,0,1, numEq,2,numComp,2)];  
                                     const double A_11_1 = A_p[INDEX5(k,1,m,1,1, numEq,2,numComp,2)];  
                                     const double A_00_2 = A_p[INDEX5(k,0,m,0,2, numEq,2,numComp,2)];  
                                     const double A_01_2 = A_p[INDEX5(k,0,m,1,2, numEq,2,numComp,2)];  
                                     const double A_10_2 = A_p[INDEX5(k,1,m,0,2, numEq,2,numComp,2)];  
                                     const double A_11_2 = A_p[INDEX5(k,1,m,1,2, numEq,2,numComp,2)];  
                                     const double A_00_3 = A_p[INDEX5(k,0,m,0,3, numEq,2,numComp,2)];  
                                     const double A_01_3 = A_p[INDEX5(k,0,m,1,3, numEq,2,numComp,2)];  
                                     const double A_10_3 = A_p[INDEX5(k,1,m,0,3, numEq,2,numComp,2)];  
                                     const double A_11_3 = A_p[INDEX5(k,1,m,1,3, numEq,2,numComp,2)];  
                                     const double tmp0_0 = A_01_0 + A_01_3;  
                                     const double tmp1_0 = A_00_0 + A_00_1;  
                                     const double tmp2_0 = A_11_0 + A_11_1 + A_11_2 + A_11_3;  
                                     const double tmp3_0 = A_00_2 + A_00_3;  
                                     const double tmp4_0 = A_10_1 + A_10_2;  
                                     const double tmp5_0 = A_00_0 + A_00_1 + A_00_2 + A_00_3;  
                                     const double tmp6_0 = A_01_3 + A_10_0;  
                                     const double tmp7_0 = A_01_0 + A_10_3;  
                                     const double tmp8_0 = A_01_1 + A_01_2 + A_10_1 + A_10_2;  
                                     const double tmp9_0 = A_01_0 + A_10_0;  
                                     const double tmp10_0 = A_01_3 + A_10_3;  
                                     const double tmp11_0 = A_11_1 + A_11_3;  
                                     const double tmp12_0 = A_11_0 + A_11_2;  
                                     const double tmp13_0 = A_01_2 + A_10_1;  
                                     const double tmp14_0 = A_01_0 + A_01_3 + A_10_0 + A_10_3;  
                                     const double tmp15_0 = A_01_1 + A_10_2;  
                                     const double tmp16_0 = A_10_0 + A_10_3;  
                                     const double tmp17_0 = A_01_1 + A_01_2;  
                                     const double tmp18_0 = A_01_1 + A_10_1;  
                                     const double tmp19_0 = A_01_2 + A_10_2;  
                                     const double tmp0_1 = A_10_3*w8;  
                                     const double tmp1_1 = tmp0_0*w1;  
                                     const double tmp2_1 = A_01_1*w4;  
                                     const double tmp3_1 = tmp1_0*w0;  
                                     const double tmp4_1 = A_01_2*w7;  
                                     const double tmp5_1 = tmp2_0*w3;  
                                     const double tmp6_1 = tmp3_0*w6;  
                                     const double tmp7_1 = A_10_0*w2;  
                                     const double tmp8_1 = tmp4_0*w5;  
                                     const double tmp9_1 = tmp2_0*w10;  
                                     const double tmp10_1 = tmp5_0*w9;  
                                     const double tmp11_1 = tmp6_0*w7;  
                                     const double tmp12_1 = tmp7_0*w4;  
                                     const double tmp13_1 = tmp8_0*w1;  
                                     const double tmp14_1 = A_10_0*w8;  
                                     const double tmp15_1 = A_01_2*w4;  
                                     const double tmp16_1 = tmp3_0*w0;  
                                     const double tmp17_1 = A_01_1*w7;  
                                     const double tmp18_1 = tmp1_0*w6;  
                                     const double tmp19_1 = A_10_3*w2;  
                                     const double tmp20_1 = tmp9_0*w4;  
                                     const double tmp21_1 = tmp1_0*w11;  
                                     const double tmp22_1 = tmp10_0*w7;  
                                     const double tmp23_1 = tmp3_0*w14;  
                                     const double tmp24_1 = tmp11_0*w13;  
                                     const double tmp25_1 = tmp12_0*w12;  
                                     const double tmp26_1 = tmp10_0*w4;  
                                     const double tmp27_1 = tmp3_0*w11;  
                                     const double tmp28_1 = tmp9_0*w7;  
                                     const double tmp29_1 = tmp1_0*w14;  
                                     const double tmp30_1 = tmp12_0*w13;  
                                     const double tmp31_1 = tmp11_0*w12;  
                                     const double tmp32_1 = tmp13_0*w2;  
                                     const double tmp33_1 = tmp14_0*w5;  
                                     const double tmp34_1 = tmp15_0*w8;  
                                     const double tmp35_1 = A_01_0*w8;  
                                     const double tmp36_1 = tmp16_0*w1;  
                                     const double tmp37_1 = A_10_1*w4;  
                                     const double tmp38_1 = tmp5_0*w15;  
                                     const double tmp39_1 = A_10_2*w7;  
                                     const double tmp40_1 = tmp11_0*w17;  
                                     const double tmp41_1 = A_01_3*w2;  
                                     const double tmp42_1 = tmp12_0*w16;  
                                     const double tmp43_1 = tmp17_0*w5;  
                                     const double tmp44_1 = tmp7_0*w7;  
                                     const double tmp45_1 = tmp6_0*w4;  
                                     const double tmp46_1 = A_01_3*w8;  
                                     const double tmp47_1 = A_10_2*w4;  
                                     const double tmp48_1 = A_10_1*w7;  
                                     const double tmp49_1 = tmp12_0*w17;  
                                     const double tmp50_1 = A_01_0*w2;  
                                     const double tmp51_1 = tmp11_0*w16;  
                                     const double tmp52_1 = tmp18_0*w8;  
                                     const double tmp53_1 = tmp19_0*w2;  
                                     const double tmp54_1 = tmp13_0*w8;  
                                     const double tmp55_1 = tmp15_0*w2;  
                                     const double tmp56_1 = tmp19_0*w8;  
                                     const double tmp57_1 = tmp18_0*w2;  
                                     EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp13_1 + tmp20_1 + tmp21_1 + tmp22_1 + tmp23_1 + tmp24_1 + tmp25_1;  
                                     EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp36_1 + tmp37_1 + tmp39_1 + tmp3_1 + tmp43_1 + tmp46_1 + tmp50_1 + tmp5_1 + tmp6_1;  
                                     EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp0_1 + tmp15_1 + tmp17_1 + tmp1_1 + tmp38_1 + tmp49_1 + tmp51_1 + tmp7_1 + tmp8_1;  
                                     EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp10_1 + tmp32_1 + tmp33_1 + tmp34_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1 + tmp4_1 + tmp5_1 + tmp6_1 + tmp7_1 + tmp8_1;  
                                     EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp21_1 + tmp23_1 + tmp30_1 + tmp31_1 + tmp33_1 + tmp56_1 + tmp57_1;  
                                     EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp10_1 + tmp13_1 + tmp44_1 + tmp45_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp35_1 + tmp36_1 + tmp37_1 + tmp38_1 + tmp39_1 + tmp40_1 + tmp41_1 + tmp42_1 + tmp43_1;  
                                     EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp36_1 + tmp38_1 + tmp43_1 + tmp46_1 + tmp47_1 + tmp48_1 + tmp49_1 + tmp50_1 + tmp51_1;  
                                     EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp24_1 + tmp25_1 + tmp27_1 + tmp29_1 + tmp33_1 + tmp52_1 + tmp53_1;  
                                     EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp14_1 + tmp15_1 + tmp16_1 + tmp17_1 + tmp18_1 + tmp19_1 + tmp1_1 + tmp5_1 + tmp8_1;  
                                     EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp10_1 + tmp33_1 + tmp54_1 + tmp55_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp14_1 + tmp19_1 + tmp1_1 + tmp2_1 + tmp38_1 + tmp40_1 + tmp42_1 + tmp4_1 + tmp8_1;  
                                     EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp16_1 + tmp18_1 + tmp35_1 + tmp36_1 + tmp41_1 + tmp43_1 + tmp47_1 + tmp48_1 + tmp5_1;  
                                     EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp13_1 + tmp26_1 + tmp27_1 + tmp28_1 + tmp29_1 + tmp30_1 + tmp31_1;  
                                 }  
                             }  
                         } else { // constant data  
                             for (index_t k=0; k<numEq; k++) {  
                                 for (index_t m=0; m<numComp; m++) {  
                                     const double A_00 = A_p[INDEX4(k,0,m,0, numEq,2, numComp)];  
                                     const double A_01 = A_p[INDEX4(k,0,m,1, numEq,2, numComp)];  
                                     const double A_10 = A_p[INDEX4(k,1,m,0, numEq,2, numComp)];  
                                     const double A_11 = A_p[INDEX4(k,1,m,1, numEq,2, numComp)];  
                                     const double tmp0_0 = A_01 + A_10;  
                                     const double tmp0_1 = A_00*w18;  
                                     const double tmp1_1 = A_01*w19;  
                                     const double tmp2_1 = A_10*w20;  
                                     const double tmp3_1 = A_11*w21;  
                                     const double tmp4_1 = A_00*w22;  
                                     const double tmp5_1 = tmp0_0*w19;  
                                     const double tmp6_1 = A_11*w23;  
                                     const double tmp7_1 = A_11*w25;  
                                     const double tmp8_1 = A_00*w24;  
                                     const double tmp9_1 = tmp0_0*w20;  
                                     const double tmp10_1 = A_01*w20;  
                                     const double tmp11_1 = A_11*w27;  
                                     const double tmp12_1 = A_00*w26;  
                                     const double tmp13_1 = A_10*w19;  
                                     EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp5_1 + tmp7_1 + tmp8_1;  
                                     EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp0_1 + tmp10_1 + tmp13_1 + tmp3_1;  
                                     EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp11_1 + tmp12_1 + tmp1_1 + tmp2_1;  
                                     EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp4_1 + tmp6_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                                     EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp7_1 + tmp8_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp4_1 + tmp5_1 + tmp6_1;  
                                     EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1;  
                                     EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1;  
                                     EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp4_1 + tmp5_1 + tmp6_1;  
                                     EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp7_1 + tmp8_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                                     EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp4_1 + tmp6_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp11_1 + tmp12_1 + tmp1_1 + tmp2_1;  
                                     EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp0_1 + tmp10_1 + tmp13_1 + tmp3_1;  
                                     EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp5_1 + tmp7_1 + tmp8_1;  
                                 }  
                             }  
                         }  
                     }  
                     ///////////////  
                     // process B //  
                     ///////////////  
                     if (!B.isEmpty()) {  
                         add_EM_S=true;  
                         const double* B_p=const_cast<escript::Data*>(&B)->getSampleDataRO(e);  
                         if (B.actsExpanded()) {  
                             for (index_t k=0; k<numEq; k++) {  
                                 for (index_t m=0; m<numComp; m++) {  
                                     const double B_0_0 = B_p[INDEX4(k,0,m,0, numEq,2,numComp)];  
                                     const double B_1_0 = B_p[INDEX4(k,1,m,0, numEq,2,numComp)];  
                                     const double B_0_1 = B_p[INDEX4(k,0,m,1, numEq,2,numComp)];  
                                     const double B_1_1 = B_p[INDEX4(k,1,m,1, numEq,2,numComp)];  
                                     const double B_0_2 = B_p[INDEX4(k,0,m,2, numEq,2,numComp)];  
                                     const double B_1_2 = B_p[INDEX4(k,1,m,2, numEq,2,numComp)];  
                                     const double B_0_3 = B_p[INDEX4(k,0,m,3, numEq,2,numComp)];  
                                     const double B_1_3 = B_p[INDEX4(k,1,m,3, numEq,2,numComp)];  
                                     const double tmp0_0 = B_1_0 + B_1_1;  
                                     const double tmp1_0 = B_1_2 + B_1_3;  
                                     const double tmp2_0 = B_0_1 + B_0_3;  
                                     const double tmp3_0 = B_0_0 + B_0_2;  
                                     const double tmp63_1 = B_1_1*w42;  
                                     const double tmp79_1 = B_1_1*w40;  
                                     const double tmp37_1 = tmp3_0*w35;  
                                     const double tmp8_1 = tmp0_0*w32;  
                                     const double tmp71_1 = B_0_1*w34;  
                                     const double tmp19_1 = B_0_3*w31;  
                                     const double tmp15_1 = B_0_3*w34;  
                                     const double tmp9_1 = tmp3_0*w34;  
                                     const double tmp35_1 = B_1_0*w36;  
                                     const double tmp66_1 = B_0_3*w28;  
                                     const double tmp28_1 = B_1_0*w42;  
                                     const double tmp22_1 = B_1_0*w40;  
                                     const double tmp16_1 = B_1_2*w29;  
                                     const double tmp6_1 = tmp2_0*w35;  
                                     const double tmp55_1 = B_1_3*w40;  
                                     const double tmp50_1 = B_1_3*w42;  
                                     const double tmp7_1 = tmp1_0*w29;  
                                     const double tmp1_1 = tmp1_0*w32;  
                                     const double tmp57_1 = B_0_3*w30;  
                                     const double tmp18_1 = B_1_1*w32;  
                                     const double tmp53_1 = B_1_0*w41;  
                                     const double tmp61_1 = B_1_3*w36;  
                                     const double tmp27_1 = B_0_3*w38;  
                                     const double tmp64_1 = B_0_2*w30;  
                                     const double tmp76_1 = B_0_1*w38;  
                                     const double tmp39_1 = tmp2_0*w34;  
                                     const double tmp62_1 = B_0_1*w31;  
                                     const double tmp56_1 = B_0_0*w31;  
                                     const double tmp49_1 = B_1_1*w36;  
                                     const double tmp2_1 = B_0_2*w31;  
                                     const double tmp23_1 = B_0_2*w33;  
                                     const double tmp38_1 = B_1_1*w43;  
                                     const double tmp74_1 = B_1_2*w41;  
                                     const double tmp43_1 = B_1_1*w41;  
                                     const double tmp58_1 = B_0_2*w28;  
                                     const double tmp67_1 = B_0_0*w33;  
                                     const double tmp33_1 = tmp0_0*w39;  
                                     const double tmp4_1 = B_0_0*w28;  
                                     const double tmp20_1 = B_0_0*w30;  
                                     const double tmp13_1 = B_0_2*w38;  
                                     const double tmp65_1 = B_1_2*w43;  
                                     const double tmp0_1 = tmp0_0*w29;  
                                     const double tmp41_1 = tmp3_0*w33;  
                                     const double tmp73_1 = B_0_2*w37;  
                                     const double tmp69_1 = B_0_0*w38;  
                                     const double tmp48_1 = B_1_2*w39;  
                                     const double tmp59_1 = B_0_1*w33;  
                                     const double tmp17_1 = B_1_3*w41;  
                                     const double tmp5_1 = B_0_3*w33;  
                                     const double tmp3_1 = B_0_1*w30;  
                                     const double tmp21_1 = B_0_1*w28;  
                                     const double tmp42_1 = B_1_0*w29;  
                                     const double tmp54_1 = B_1_2*w32;  
                                     const double tmp60_1 = B_1_0*w39;  
                                     const double tmp32_1 = tmp1_0*w36;  
                                     const double tmp10_1 = B_0_1*w37;  
                                     const double tmp14_1 = B_0_0*w35;  
                                     const double tmp29_1 = B_0_1*w35;  
                                     const double tmp26_1 = B_1_2*w36;  
                                     const double tmp30_1 = B_1_3*w43;  
                                     const double tmp70_1 = B_0_2*w35;  
                                     const double tmp34_1 = B_1_3*w39;  
                                     const double tmp51_1 = B_1_0*w43;  
                                     const double tmp31_1 = B_0_2*w34;  
                                     const double tmp45_1 = tmp3_0*w28;  
                                     const double tmp11_1 = tmp1_0*w39;  
                                     const double tmp52_1 = B_1_1*w29;  
                                     const double tmp44_1 = B_1_3*w32;  
                                     const double tmp25_1 = B_1_1*w39;  
                                     const double tmp47_1 = tmp2_0*w33;  
                                     const double tmp72_1 = B_1_3*w29;  
                                     const double tmp40_1 = tmp2_0*w28;  
                                     const double tmp46_1 = B_1_2*w40;  
                                     const double tmp36_1 = B_1_2*w42;  
                                     const double tmp24_1 = B_0_0*w37;  
                                     const double tmp77_1 = B_0_3*w35;  
                                     const double tmp68_1 = B_0_3*w37;  
                                     const double tmp78_1 = B_0_0*w34;  
                                     const double tmp12_1 = tmp0_0*w36;  
                                     const double tmp75_1 = B_1_0*w32;  
                                     EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp16_1 + tmp17_1 + tmp18_1 + tmp19_1 + tmp20_1 + tmp21_1 + tmp22_1 + tmp23_1;  
                                     EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp68_1 + tmp69_1 + tmp70_1 + tmp71_1;  
                                     EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp45_1 + tmp47_1 + tmp48_1 + tmp49_1 + tmp50_1 + tmp51_1;  
                                     EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp32_1 + tmp33_1 + tmp6_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1 + tmp4_1 + tmp5_1;  
                                     EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp72_1 + tmp73_1 + tmp74_1 + tmp75_1 + tmp76_1 + tmp77_1 + tmp78_1 + tmp79_1;  
                                     EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp32_1 + tmp33_1 + tmp40_1 + tmp41_1;  
                                     EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp34_1 + tmp35_1 + tmp36_1 + tmp37_1 + tmp38_1 + tmp39_1;  
                                     EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp42_1 + tmp43_1 + tmp44_1 + tmp45_1 + tmp46_1 + tmp47_1;  
                                     EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp6_1 + tmp7_1 + tmp8_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp60_1 + tmp61_1 + tmp62_1 + tmp63_1 + tmp64_1 + tmp65_1 + tmp66_1 + tmp67_1;  
                                     EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1 + tmp14_1 + tmp15_1;  
                                     EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp40_1 + tmp41_1 + tmp7_1 + tmp8_1;  
                                     EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp37_1 + tmp39_1 + tmp52_1 + tmp53_1 + tmp54_1 + tmp55_1;  
                                     EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp11_1 + tmp12_1 + tmp56_1 + tmp57_1 + tmp58_1 + tmp59_1;  
                                     EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp24_1 + tmp25_1 + tmp26_1 + tmp27_1 + tmp28_1 + tmp29_1 + tmp30_1 + tmp31_1;  
                                 }  
                             }  
                         } else { // constant data  
                             for (index_t k=0; k<numEq; k++) {  
                                 for (index_t m=0; m<numComp; m++) {  
                                     const double B_0 = B_p[INDEX3(k,0,m, numEq, 2)];  
                                     const double B_1 = B_p[INDEX3(k,1,m, numEq, 2)];  
                                     const double tmp6_1 = B_1*w50;  
                                     const double tmp1_1 = B_1*w45;  
                                     const double tmp5_1 = B_1*w49;  
                                     const double tmp4_1 = B_1*w48;  
                                     const double tmp0_1 = B_0*w44;  
                                     const double tmp2_1 = B_0*w46;  
                                     const double tmp7_1 = B_0*w51;  
                                     const double tmp3_1 = B_0*w47;  
                                     EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp0_1 + tmp5_1;  
                                     EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp1_1 + tmp3_1;  
                                     EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp6_1 + tmp7_1;  
                                     EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp2_1 + tmp4_1;  
                                     EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                     EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp3_1 + tmp5_1;  
                                     EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp4_1 + tmp7_1;  
                                     EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp2_1 + tmp6_1;  
                                     EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp5_1 + tmp7_1;  
                                     EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp1_1 + tmp2_1;  
                                     EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp0_1 + tmp6_1;  
                                     EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp3_1 + tmp4_1;  
                                     EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp1_1 + tmp7_1;  
                                     EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp2_1 + tmp5_1;  
                                     EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp0_1 + tmp4_1;  
                                     EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp3_1 + tmp6_1;  
                                 }  
                             }  
                         }  
                     }  
                     ///////////////  
                     // process C //  
                     ///////////////  
                     if (!C.isEmpty()) {  
                         add_EM_S=true;  
                         const double* C_p=const_cast<escript::Data*>(&C)->getSampleDataRO(e);  
                         if (C.actsExpanded()) {  
                             for (index_t k=0; k<numEq; k++) {  
                                 for (index_t m=0; m<numComp; m++) {  
                                     const double C_0_0 = C_p[INDEX4(k,m,0, 0, numEq,numComp,2)];  
                                     const double C_1_0 = C_p[INDEX4(k,m,1, 0, numEq,numComp,2)];  
                                     const double C_0_1 = C_p[INDEX4(k,m,0, 1, numEq,numComp,2)];  
                                     const double C_1_1 = C_p[INDEX4(k,m,1, 1, numEq,numComp,2)];  
                                     const double C_0_2 = C_p[INDEX4(k,m,0, 2, numEq,numComp,2)];  
                                     const double C_1_2 = C_p[INDEX4(k,m,1, 2, numEq,numComp,2)];  
                                     const double C_0_3 = C_p[INDEX4(k,m,0, 3, numEq,numComp,2)];  
                                     const double C_1_3 = C_p[INDEX4(k,m,1, 3, numEq,numComp,2)];  
                                     const double tmp2_0 = C_0_1 + C_0_3;  
                                     const double tmp1_0 = C_1_2 + C_1_3;  
                                     const double tmp3_0 = C_0_0 + C_0_2;  
                                     const double tmp0_0 = C_1_0 + C_1_1;  
                                     const double tmp64_1 = C_0_2*w30;  
                                     const double tmp14_1 = C_0_2*w28;  
                                     const double tmp19_1 = C_0_3*w31;  
                                     const double tmp22_1 = C_1_0*w40;  
                                     const double tmp37_1 = tmp3_0*w35;  
                                     const double tmp29_1 = C_0_1*w35;  
                                     const double tmp73_1 = C_0_2*w37;  
                                     const double tmp74_1 = C_1_2*w41;  
                                     const double tmp52_1 = C_1_3*w39;  
                                     const double tmp25_1 = C_1_1*w39;  
                                     const double tmp62_1 = C_0_1*w31;  
                                     const double tmp79_1 = C_1_1*w40;  
                                     const double tmp43_1 = C_1_1*w36;  
                                     const double tmp27_1 = C_0_3*w38;  
                                     const double tmp28_1 = C_1_0*w42;  
                                     const double tmp63_1 = C_1_1*w42;  
                                     const double tmp59_1 = C_0_3*w34;  
                                     const double tmp72_1 = C_1_3*w29;  
                                     const double tmp40_1 = tmp2_0*w35;  
                                     const double tmp13_1 = C_0_3*w30;  
                                     const double tmp51_1 = C_1_2*w40;  
                                     const double tmp54_1 = C_1_2*w42;  
                                     const double tmp12_1 = C_0_0*w31;  
                                     const double tmp2_1 = tmp1_0*w32;  
                                     const double tmp68_1 = C_0_2*w31;  
                                     const double tmp75_1 = C_1_0*w32;  
                                     const double tmp49_1 = C_1_1*w41;  
                                     const double tmp4_1 = C_0_2*w35;  
                                     const double tmp66_1 = C_0_3*w28;  
                                     const double tmp56_1 = C_0_1*w37;  
                                     const double tmp5_1 = C_0_1*w34;  
                                     const double tmp38_1 = tmp2_0*w34;  
                                     const double tmp76_1 = C_0_1*w38;  
                                     const double tmp21_1 = C_0_1*w28;  
                                     const double tmp69_1 = C_0_1*w30;  
                                     const double tmp53_1 = C_1_0*w36;  
                                     const double tmp42_1 = C_1_2*w39;  
                                     const double tmp32_1 = tmp1_0*w29;  
                                     const double tmp45_1 = C_1_0*w43;  
                                     const double tmp33_1 = tmp0_0*w32;  
                                     const double tmp35_1 = C_1_0*w41;  
                                     const double tmp26_1 = C_1_2*w36;  
                                     const double tmp67_1 = C_0_0*w33;  
                                     const double tmp31_1 = C_0_2*w34;  
                                     const double tmp20_1 = C_0_0*w30;  
                                     const double tmp70_1 = C_0_0*w28;  
                                     const double tmp8_1 = tmp0_0*w39;  
                                     const double tmp30_1 = C_1_3*w43;  
                                     const double tmp0_1 = tmp0_0*w29;  
                                     const double tmp17_1 = C_1_3*w41;  
                                     const double tmp58_1 = C_0_0*w35;  
                                     const double tmp9_1 = tmp3_0*w33;  
                                     const double tmp61_1 = C_1_3*w36;  
                                     const double tmp41_1 = tmp3_0*w34;  
                                     const double tmp50_1 = C_1_3*w32;  
                                     const double tmp18_1 = C_1_1*w32;  
                                     const double tmp6_1 = tmp1_0*w36;  
                                     const double tmp3_1 = C_0_0*w38;  
                                     const double tmp34_1 = C_1_1*w29;  
                                     const double tmp77_1 = C_0_3*w35;  
                                     const double tmp65_1 = C_1_2*w43;  
                                     const double tmp71_1 = C_0_3*w33;  
                                     const double tmp55_1 = C_1_1*w43;  
                                     const double tmp46_1 = tmp3_0*w28;  
                                     const double tmp24_1 = C_0_0*w37;  
                                     const double tmp10_1 = tmp1_0*w39;  
                                     const double tmp48_1 = C_1_0*w29;  
                                     const double tmp15_1 = C_0_1*w33;  
                                     const double tmp36_1 = C_1_2*w32;  
                                     const double tmp60_1 = C_1_0*w39;  
                                     const double tmp47_1 = tmp2_0*w33;  
                                     const double tmp16_1 = C_1_2*w29;  
                                     const double tmp1_1 = C_0_3*w37;  
                                     const double tmp7_1 = tmp2_0*w28;  
                                     const double tmp39_1 = C_1_3*w40;  
                                     const double tmp44_1 = C_1_3*w42;  
                                     const double tmp57_1 = C_0_2*w38;  
                                     const double tmp78_1 = C_0_0*w34;  
                                     const double tmp11_1 = tmp0_0*w36;  
                                     const double tmp23_1 = C_0_2*w33;  
                                     EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1 + tmp4_1 + tmp5_1;  
                                     EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp6_1 + tmp7_1 + tmp8_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp10_1 + tmp11_1 + tmp12_1 + tmp13_1 + tmp14_1 + tmp15_1;  
                                     EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp16_1 + tmp17_1 + tmp18_1 + tmp19_1 + tmp20_1 + tmp21_1 + tmp22_1 + tmp23_1;  
                                     EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp24_1 + tmp25_1 + tmp26_1 + tmp27_1 + tmp28_1 + tmp29_1 + tmp30_1 + tmp31_1;  
                                     EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp32_1 + tmp33_1 + tmp7_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp34_1 + tmp35_1 + tmp36_1 + tmp37_1 + tmp38_1 + tmp39_1;  
                                     EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp32_1 + tmp33_1 + tmp40_1 + tmp41_1;  
                                     EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp42_1 + tmp43_1 + tmp44_1 + tmp45_1 + tmp46_1 + tmp47_1;  
                                     EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp46_1 + tmp47_1 + tmp48_1 + tmp49_1 + tmp50_1 + tmp51_1;  
                                     EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp37_1 + tmp38_1 + tmp52_1 + tmp53_1 + tmp54_1 + tmp55_1;  
                                     EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp10_1 + tmp11_1 + tmp56_1 + tmp57_1 + tmp58_1 + tmp59_1;  
                                     EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp60_1 + tmp61_1 + tmp62_1 + tmp63_1 + tmp64_1 + tmp65_1 + tmp66_1 + tmp67_1;  
                                     EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp0_1 + tmp2_1 + tmp68_1 + tmp69_1 + tmp70_1 + tmp71_1;  
                                     EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp40_1 + tmp41_1 + tmp6_1 + tmp8_1;  
                                     EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp72_1 + tmp73_1 + tmp74_1 + tmp75_1 + tmp76_1 + tmp77_1 + tmp78_1 + tmp79_1;  
                                 }  
                             }  
                         } else { // constant data  
                             for (index_t k=0; k<numEq; k++) {  
                                 for (index_t m=0; m<numComp; m++) {  
                                     const double C_0 = C_p[INDEX3(k, m, 0, numEq, numComp)];  
                                     const double C_1 = C_p[INDEX3(k, m, 1, numEq, numComp)];  
                                     const double tmp1_1 = C_1*w45;  
                                     const double tmp3_1 = C_0*w51;  
                                     const double tmp4_1 = C_0*w44;  
                                     const double tmp7_1 = C_0*w46;  
                                     const double tmp5_1 = C_1*w49;  
                                     const double tmp2_1 = C_1*w48;  
                                     const double tmp0_1 = C_0*w47;  
                                     const double tmp6_1 = C_1*w50;  
                                     EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                     EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp2_1 + tmp3_1;  
                                     EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp2_1 + tmp4_1;  
                                     EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp4_1 + tmp5_1;  
                                     EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp0_1 + tmp6_1;  
                                     EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp1_1 + tmp3_1;  
                                     EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp5_1 + tmp7_1;  
                                     EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp1_1 + tmp7_1;  
                                     EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp3_1 + tmp6_1;  
                                     EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp3_1 + tmp5_1;  
                                     EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp6_1 + tmp7_1;  
                                     EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp0_1 + tmp2_1;  
                                     EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp4_1 + tmp6_1;  
                                     EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp1_1 + tmp4_1;  
                                     EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp2_1 + tmp7_1;  
                                     EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp0_1 + tmp5_1;  
                                 }  
                             }  
                         }  
                     }  
                     ///////////////  
                     // process D //  
                     ///////////////  
                     if (!D.isEmpty()) {  
                         add_EM_S=true;  
                         const double* D_p=const_cast<escript::Data*>(&D)->getSampleDataRO(e);  
                         if (D.actsExpanded()) {  
                             for (index_t k=0; k<numEq; k++) {  
                                 for (index_t m=0; m<numComp; m++) {  
                                     const double D_0 = D_p[INDEX3(k, m, 0, numEq, numComp)];  
                                     const double D_1 = D_p[INDEX3(k, m, 1, numEq, numComp)];  
                                     const double D_2 = D_p[INDEX3(k, m, 2, numEq, numComp)];  
                                     const double D_3 = D_p[INDEX3(k, m, 3, numEq, numComp)];  
                                     const double tmp4_0 = D_1 + D_3;  
                                     const double tmp2_0 = D_0 + D_1 + D_2 + D_3;  
                                     const double tmp5_0 = D_0 + D_2;  
                                     const double tmp0_0 = D_0 + D_1;  
                                     const double tmp6_0 = D_0 + D_3;  
                                     const double tmp1_0 = D_2 + D_3;  
                                     const double tmp3_0 = D_1 + D_2;  
                                     const double tmp16_1 = D_1*w56;  
                                     const double tmp14_1 = tmp6_0*w54;  
                                     const double tmp8_1 = D_3*w55;  
                                     const double tmp2_1 = tmp2_0*w54;  
                                     const double tmp12_1 = tmp5_0*w52;  
                                     const double tmp4_1 = tmp0_0*w53;  
                                     const double tmp3_1 = tmp1_0*w52;  
                                     const double tmp13_1 = tmp4_0*w53;  
                                     const double tmp10_1 = tmp4_0*w52;  
                                     const double tmp1_1 = tmp1_0*w53;  
                                     const double tmp7_1 = D_3*w56;  
                                     const double tmp0_1 = tmp0_0*w52;  
                                     const double tmp11_1 = tmp5_0*w53;  
                                     const double tmp9_1 = D_0*w56;  
                                     const double tmp5_1 = tmp3_0*w54;  
                                     const double tmp18_1 = D_2*w56;  
                                     const double tmp17_1 = D_1*w55;  
                                     const double tmp6_1 = D_0*w55;  
                                     const double tmp15_1 = D_2*w55;  
                                     EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                     EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp2_1;  
                                     EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp3_1 + tmp4_1;  
                                     EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp5_1 + tmp6_1 + tmp7_1;  
                                     EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp5_1 + tmp8_1 + tmp9_1;  
                                     EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp2_1;  
                                     EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp10_1 + tmp11_1;  
                                     EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp2_1;  
                                     EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp12_1 + tmp13_1;  
                                     EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp12_1 + tmp13_1;  
                                     EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp10_1 + tmp11_1;  
                                     EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp3_1 + tmp4_1;  
                                     EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp14_1 + tmp15_1 + tmp16_1;  
                                     EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                     EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp2_1;  
                                     EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp14_1 + tmp17_1 + tmp18_1;  
                                 }  
                              }  
                         } else { // constant data  
                             for (index_t k=0; k<numEq; k++) {  
                                 for (index_t m=0; m<numComp; m++) {  
                                     const double D_0 = D_p[INDEX2(k, m, numEq)];  
                                     const double tmp2_1 = D_0*w59;  
                                     const double tmp1_1 = D_0*w58;  
                                     const double tmp0_1 = D_0*w57;  
                                     EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1;  
                                     EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp1_1;  
                                     EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp0_1;  
                                     EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp2_1;  
                                     EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp2_1;  
                                     EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp1_1;  
                                     EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp0_1;  
                                     EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp1_1;  
                                     EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp0_1;  
                                     EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp0_1;  
                                     EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp0_1;  
                                     EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp0_1;  
                                     EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp2_1;  
                                     EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp0_1;  
                                     EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp1_1;  
                                     EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp2_1;  
                                 }  
                             }  
                         }  
                     }  
                     ///////////////  
                     // process X //  
                     ///////////////  
                     if (!X.isEmpty()) {  
                         add_EM_F=true;  
                         const double* X_p=const_cast<escript::Data*>(&X)->getSampleDataRO(e);  
                         if (X.actsExpanded()) {  
                             for (index_t k=0; k<numEq; k++) {  
                                 const double X_0_0 = X_p[INDEX3(k, 0, 0, numEq, 2)];  
                                 const double X_1_0 = X_p[INDEX3(k, 1, 0, numEq, 2)];  
                                 const double X_0_1 = X_p[INDEX3(k, 0, 1, numEq, 2)];  
                                 const double X_1_1 = X_p[INDEX3(k, 1, 1, numEq, 2)];  
                                 const double X_0_2 = X_p[INDEX3(k, 0, 2, numEq, 2)];  
                                 const double X_1_2 = X_p[INDEX3(k, 1, 2, numEq, 2)];  
                                 const double X_0_3 = X_p[INDEX3(k, 0, 3, numEq, 2)];  
                                 const double X_1_3 = X_p[INDEX3(k, 1, 3, numEq, 2)];  
                                 const double tmp1_0 = X_1_1 + X_1_3;  
                                 const double tmp3_0 = X_0_0 + X_0_1;  
                                 const double tmp2_0 = X_1_0 + X_1_2;  
                                 const double tmp0_0 = X_0_2 + X_0_3;  
                                 const double tmp8_1 = tmp2_0*w66;  
                                 const double tmp5_1 = tmp3_0*w64;  
                                 const double tmp14_1 = tmp0_0*w64;  
                                 const double tmp3_1 = tmp3_0*w60;  
                                 const double tmp9_1 = tmp3_0*w63;  
                                 const double tmp13_1 = tmp3_0*w65;  
                                 const double tmp12_1 = tmp1_0*w66;  
                                 const double tmp10_1 = tmp0_0*w60;  
                                 const double tmp2_1 = tmp2_0*w61;  
                                 const double tmp6_1 = tmp2_0*w62;  
                                 const double tmp4_1 = tmp0_0*w65;  
                                 const double tmp11_1 = tmp1_0*w67;  
                                 const double tmp1_1 = tmp1_0*w62;  
                                 const double tmp7_1 = tmp1_0*w61;  
                                 const double tmp0_1 = tmp0_0*w63;  
                                 const double tmp15_1 = tmp2_0*w67;  
                                 EM_F[INDEX2(k,0,numEq)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                                 EM_F[INDEX2(k,1,numEq)]+=tmp4_1 + tmp5_1 + tmp6_1 + tmp7_1;  
                                 EM_F[INDEX2(k,2,numEq)]+=tmp10_1 + tmp11_1 + tmp8_1 + tmp9_1;  
                                 EM_F[INDEX2(k,3,numEq)]+=tmp12_1 + tmp13_1 + tmp14_1 + tmp15_1;  
                             }  
                         } else { // constant data  
                             for (index_t k=0; k<numEq; k++) {  
                                 const double X_0 = X_p[INDEX2(k, 0, numEq)];  
                                 const double X_1 = X_p[INDEX2(k, 1, numEq)];  
                                 const double tmp0_1 = X_1*w69;  
                                 const double tmp1_1 = X_0*w68;  
                                 const double tmp2_1 = X_0*w70;  
                                 const double tmp3_1 = X_1*w71;  
                                 EM_F[INDEX2(k,0,numEq)]+=tmp0_1 + tmp1_1;  
                                 EM_F[INDEX2(k,1,numEq)]+=tmp0_1 + tmp2_1;  
                                 EM_F[INDEX2(k,2,numEq)]+=tmp1_1 + tmp3_1;  
                                 EM_F[INDEX2(k,3,numEq)]+=tmp2_1 + tmp3_1;  
                             }  
                         }  
                     }  
                     ///////////////  
                     // process Y //  
                     ///////////////  
                     if (!Y.isEmpty()) {  
                         add_EM_F=true;  
                         const double* Y_p=const_cast<escript::Data*>(&Y)->getSampleDataRO(e);  
                         if (Y.actsExpanded()) {  
                             for (index_t k=0; k<numEq; k++) {  
                                 const double Y_0 = Y_p[INDEX2(k, 0, numEq)];  
                                 const double Y_1 = Y_p[INDEX2(k, 1, numEq)];  
                                 const double Y_2 = Y_p[INDEX2(k, 2, numEq)];  
                                 const double Y_3 = Y_p[INDEX2(k, 3, numEq)];  
                                 const double tmp0_0 = Y_1 + Y_2;  
                                 const double tmp1_0 = Y_0 + Y_3;  
                                 const double tmp0_1 = Y_0*w72;  
                                 const double tmp1_1 = tmp0_0*w73;  
                                 const double tmp2_1 = Y_3*w74;  
                                 const double tmp3_1 = Y_1*w72;  
                                 const double tmp4_1 = tmp1_0*w73;  
                                 const double tmp5_1 = Y_2*w74;  
                                 const double tmp6_1 = Y_2*w72;  
                                 const double tmp7_1 = Y_1*w74;  
                                 const double tmp8_1 = Y_3*w72;  
                                 const double tmp9_1 = Y_0*w74;  
                                 EM_F[INDEX2(k,0,numEq)]+=tmp0_1 + tmp1_1 + tmp2_1;  
                                 EM_F[INDEX2(k,1,numEq)]+=tmp3_1 + tmp4_1 + tmp5_1;  
                                 EM_F[INDEX2(k,2,numEq)]+=tmp4_1 + tmp6_1 + tmp7_1;  
                                 EM_F[INDEX2(k,3,numEq)]+=tmp1_1 + tmp8_1 + tmp9_1;  
                             }  
                         } else { // constant data  
                             for (index_t k=0; k<numEq; k++) {  
                                 const double tmp0_1 = Y_p[k]*w75;  
                                 EM_F[INDEX2(k,0,numEq)]+=tmp0_1;  
                                 EM_F[INDEX2(k,1,numEq)]+=tmp0_1;  
                                 EM_F[INDEX2(k,2,numEq)]+=tmp0_1;  
                                 EM_F[INDEX2(k,3,numEq)]+=tmp0_1;  
                             }  
                         }  
                     }  
1952    
1953                      // add to matrix (if add_EM_S) and RHS (if add_EM_F)  All local calculation is done on an array called `src`, with
1954                      const index_t firstNode=m_N0*k1+k0;  dimensions = ext[0] * ext[1].
1955                      addToMatrixAndRHS(mat, rhs, EM_S, EM_F, add_EM_S, add_EM_F,  Where ext[i]= internal[i]+2*radius.
                             firstNode, numEq, numComp);  
                 } // end k0 loop  
             } // end k1 loop  
         } // end of colouring  
     } // end of parallel region  
 }  
1956    
1957  //protected  Now for MPI there is overlap to deal with. We need to share both the overlapping
1958  void Rectangle::assemblePDESystemReduced(Paso_SystemMatrix* mat,  values themselves but also the external region.
         escript::Data& rhs, const escript::Data& A, const escript::Data& B,  
         const escript::Data& C, const escript::Data& D,  
         const escript::Data& X, const escript::Data& Y) const  
 {  
     const double h0 = m_l0/m_gNE0;  
     const double h1 = m_l1/m_gNE1;  
     dim_t numEq, numComp;  
     if (!mat)  
         numEq=numComp=(rhs.isEmpty() ? 1 : rhs.getDataPointSize());  
     else {  
         numEq=mat->logical_row_block_size;  
         numComp=mat->logical_col_block_size;  
     }  
   
     const double w0 = -.25*h1/h0;  
     const double w1 = .25;  
     const double w2 = -.25;  
     const double w3 = .25*h0/h1;  
     const double w4 = -.25*h0/h1;  
     const double w5 = .25*h1/h0;  
     const double w6 = -.125*h1;  
     const double w7 = -.125*h0;  
     const double w8 = .125*h1;  
     const double w9 = .125*h0;  
     const double w10 = .0625*h0*h1;  
     const double w11 = -.5*h1;  
     const double w12 = -.5*h0;  
     const double w13 = .5*h1;  
     const double w14 = .5*h0;  
     const double w15 = .25*h0*h1;  
1959    
1960      rhs.requireWrite();  In a hypothetical 1-D case:
 #pragma omp parallel  
     {  
         for (index_t k1_0=0; k1_0<2; k1_0++) { // colouring  
 #pragma omp for  
             for (index_t k1=k1_0; k1<m_NE1; k1+=2) {  
                 for (index_t k0=0; k0<m_NE0; ++k0)  {  
                     bool add_EM_S=false;  
                     bool add_EM_F=false;  
                     vector<double> EM_S(4*4*numEq*numComp, 0);  
                     vector<double> EM_F(4*numEq, 0);  
                     const index_t e = k0 + m_NE0*k1;  
                     ///////////////  
                     // process A //  
                     ///////////////  
                     if (!A.isEmpty()) {  
                         add_EM_S=true;  
                         const double* A_p=const_cast<escript::Data*>(&A)->getSampleDataRO(e);  
                         for (index_t k=0; k<numEq; k++) {  
                             for (index_t m=0; m<numComp; m++) {  
                                 const double A_00 = A_p[INDEX4(k,0,m,0, numEq,2, numComp)];  
                                 const double A_01 = A_p[INDEX4(k,0,m,1, numEq,2, numComp)];  
                                 const double A_10 = A_p[INDEX4(k,1,m,0, numEq,2, numComp)];  
                                 const double A_11 = A_p[INDEX4(k,1,m,1, numEq,2, numComp)];  
                                 const double tmp0_0 = A_01 + A_10;  
                                 const double tmp0_1 = A_11*w3;  
                                 const double tmp1_1 = A_00*w0;  
                                 const double tmp2_1 = A_01*w1;  
                                 const double tmp3_1 = A_10*w2;  
                                 const double tmp4_1 = tmp0_0*w1;  
                                 const double tmp5_1 = A_11*w4;  
                                 const double tmp6_1 = A_00*w5;  
                                 const double tmp7_1 = tmp0_0*w2;  
                                 const double tmp8_1 = A_10*w1;  
                                 const double tmp9_1 = A_01*w2;  
                                 EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp0_1 + tmp4_1 + tmp6_1;  
                                 EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp8_1 + tmp9_1;  
                                 EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp2_1 + tmp3_1 + tmp5_1 + tmp6_1;  
                                 EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp1_1 + tmp5_1 + tmp7_1;  
                                 EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp0_1 + tmp6_1 + tmp7_1;  
                                 EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp1_1 + tmp4_1 + tmp5_1;  
                                 EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp5_1 + tmp6_1 + tmp8_1 + tmp9_1;  
                                 EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp5_1 + tmp6_1 + tmp8_1 + tmp9_1;  
                                 EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp1_1 + tmp4_1 + tmp5_1;  
                                 EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp0_1 + tmp6_1 + tmp7_1;  
                                 EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp2_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp1_1 + tmp5_1 + tmp7_1;  
                                 EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp2_1 + tmp3_1 + tmp5_1 + tmp6_1;  
                                 EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp0_1 + tmp1_1 + tmp8_1 + tmp9_1;  
                                 EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp0_1 + tmp4_1 + tmp6_1;  
                             }  
                         }  
                     }  
                     ///////////////  
                     // process B //  
                     ///////////////  
                     if (!B.isEmpty()) {  
                         add_EM_S=true;  
                         const double* B_p=const_cast<escript::Data*>(&B)->getSampleDataRO(e);  
                         for (index_t k=0; k<numEq; k++) {  
                             for (index_t m=0; m<numComp; m++) {  
                                 const double B_0 = B_p[INDEX3(k,0,m, numEq, 2)];  
                                 const double B_1 = B_p[INDEX3(k,1,m, numEq, 2)];  
                                 const double tmp0_1 = B_0*w6;  
                                 const double tmp1_1 = B_1*w7;  
                                 const double tmp2_1 = B_0*w8;  
                                 const double tmp3_1 = B_1*w9;  
                                 EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                 EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp1_1 + tmp2_1;  
                                 EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp0_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp2_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                 EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp1_1 + tmp2_1;  
                                 EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp0_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp2_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                 EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp1_1 + tmp2_1;  
                                 EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp0_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp2_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                 EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp1_1 + tmp2_1;  
                                 EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp0_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp2_1 + tmp3_1;  
                             }  
                         }  
                     }  
                     ///////////////  
                     // process C //  
                     ///////////////  
                     if (!C.isEmpty()) {  
                         add_EM_S=true;  
                         const double* C_p=const_cast<escript::Data*>(&C)->getSampleDataRO(e);  
                         for (index_t k=0; k<numEq; k++) {  
                             for (index_t m=0; m<numComp; m++) {  
                                 const double C_0 = C_p[INDEX3(k, m, 0, numEq, numComp)];  
                                 const double C_1 = C_p[INDEX3(k, m, 1, numEq, numComp)];  
                                 const double tmp0_1 = C_0*w8;  
                                 const double tmp1_1 = C_1*w7;  
                                 const double tmp2_1 = C_1*w9;  
                                 const double tmp3_1 = C_0*w6;  
                                 EM_S[INDEX4(k,m,0,0,numEq,numComp,4)]+=tmp1_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,1,0,numEq,numComp,4)]+=tmp1_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,2,0,numEq,numComp,4)]+=tmp1_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,3,0,numEq,numComp,4)]+=tmp1_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,0,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                 EM_S[INDEX4(k,m,1,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                 EM_S[INDEX4(k,m,2,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                 EM_S[INDEX4(k,m,3,1,numEq,numComp,4)]+=tmp0_1 + tmp1_1;  
                                 EM_S[INDEX4(k,m,0,2,numEq,numComp,4)]+=tmp2_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,1,2,numEq,numComp,4)]+=tmp2_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,2,2,numEq,numComp,4)]+=tmp2_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,3,2,numEq,numComp,4)]+=tmp2_1 + tmp3_1;  
                                 EM_S[INDEX4(k,m,0,3,numEq,numComp,4)]+=tmp0_1 + tmp2_1;  
                                 EM_S[INDEX4(k,m,1,3,numEq,numComp,4)]+=tmp0_1 + tmp2_1;  
                                 EM_S[INDEX4(k,m,2,3,numEq,numComp,4)]+=tmp0_1 + tmp2_1;  
                                 EM_S[INDEX4(k,m,3,3,numEq,numComp,4)]+=tmp0_1 + tmp2_1;  
                             }  
                         }  
                     }  
                     ///////////////  
<